Одне число, на яке людина ставить гроші: де «відсоток правильних» бреше і чим його замінюють
Стенд про клас задачі «оцінка готовності 0–100 за банком завдань з предметними областями різної ваги». Дані на стенді — синтетичні профілі, порахованi однією і тією ж арифметикою для всіх рядків. Це не ваші користувачі й не ваша модель: ваша модель розбирається на етапі роботи, тут показано, ЩО саме перевіряється і як виглядає різниця.
01Чотири місця, де така оцінка ламається тихо
Тихо — тобто число виглядає розумним, ніхто не бачить помилки, а людина записується на платний іспит зарано або зарано лякається.
Мало відповідей = висока впевненість
Відповів на 12 завдань, усі правильно — «100». Наївний відсоток не відрізняє 12 відповідей від 400, хоча це два різних світи за надійністю.
Вибір завдань не випадковий
Людина сама тягне те, що їй легше. Відсоток правильних тоді міряє смак у виборі завдань, а не готовність.
Ваги областей з іспиту не перенесені в оцінку
Сильна область з малою вагою витягує число вгору, а провал у важкій області з великою вагою в ньому майже не чути.
Шкала 0–100 нічому не відповідає
Поки немає даних про складені іспити, «80» — це не «80% шансів скласти». Число можна тільки впорядковувати, а не читати як ймовірність. Це треба або сказати користувачеві, або перестати бути правдою.
02Ті самі люди, два способи порахувати
П'ять синтетичних профілів на банку з 520 завдань і трьох областях з вагами 0.45 / 0.35 / 0.20. Ліва колонка — наївний відсоток правильних. Права — оцінка, що враховує обсяг відповідей, ваги областей і власну невизначеність.
Профіль
Відповідей
Наївний %
Обережна оцінка
Різниця
Швидкий оптиміст36 правильних з 40, майже все — з найлегшої області
40 з 520
90
57
−33
Дуже мало даних12 з 12 правильних
12 з 520
100
54
−46
Діра у найважчій областісильний у двох легких, 9 з 15 у області з вагою 0.45
235 з 520
83
64
−19
Рівномірна підготовкаохоплені всі три області пропорційно
300 з 520
72
66
−6
Повний прохід банкупройдено майже все, результат стабільний
511 з 520
69
65
−4
Читати так: чим менше даних і чим кривіше вони розподілені по областях, тим більша різниця.Там, де людина реально пройшла банк, обидва способи майже сходяться — і це ознака, що модель не «псує» чесні випадки.
Головне не в тому, що друге число менше. Головне — що воно перестає рости від однієї легкої серії і падає саме там, де людина ще не бачила важкої частини іспиту. Останні два рядки показують межу: коли даних досить, корекція майже зникає — інакше модель просто б занижувала всіх.
03Три механізми, якими це робиться
Стягування малих вибірок до апріорного рівня. Оцінка по області рахується не як «правильні / спроби», а з урахуванням апріорного припущення. 4 з 4 перестає означати «стовідсотково»: сила стягування — параметр, який підбирається під ваш банк і рівень ваших користувачів.
Ваги областей з реального іспиту. Підсумок — зважена комбінація по областях, а не загальний відсоток. Тоді провал у важкій області видно в числі, а не лише у внутрішній статистиці.
Поправка на власну невизначеність. Оцінка публікується консервативно: чим ширший інтервал довіри (мало відповідей, нерівне охоплення), тим більший відступ від середнього. Розмір відступу — другий параметр, і саме він задає, наскільки система обережна з чужими грошима.
Обидва параметри мають зрозумілий сенс і одну чітку роль. Що вони мають бути саме такими — не віра, а результат порівняння на спільному наборі сценаріїв: та сама таблиця, тільки на ваших областях, вагах і ваших реальних розподілах спроб.
04Що змінюється, коли з'являться дані про складені іспити
Доки немає жодного відомого результату справжнього іспиту, будь-яка «ймовірність скласти» — вигадка. Тому калібрування закладається як окремий етап, який запускається пізніше і нічого не ламає:
Зараз: число впорядковує користувачів між собою і відповідає на «чи я вже готовий» обережно. Порогів «записуйся» на глухій вірі не ставимо.
Після перших результатів: оцінка зіставляється з фактом «склав / не склав», і шкала перераховується так, щоб «75» означало реальну частку тих, хто склав. Це окрема, проста процедура над уже готовою оцінкою — модель переписувати не треба.
Перевірка калібрування: графік «передбачене проти фактичного» за групами. Якщо крива відходить — переналаштовується тільки перерахунок шкали, а не вся модель.
Скільком результатам вірити: заздалегідь фіксується, з якої кількості відомих іспитів перерахунок шкали взагалі має право спрацювати. Інакше перші п'ять випадкових результатів зіпсують число всім.
05Що буває на виході такої роботи
Розбір наявної моделі: що саме вона рахує, на яких профілях вона помиляється і наскільки — числами, на спільному наборі сценаріїв.
Чесний висновок про неї: або аргументоване «ваша спроможна, змінити лише ось це», або заміна з порівнянням поруч. Обидва результати є нормальним результатом роботи.
Рекомендовані значення параметрів з поясненням, за що відповідає кожен і що станеться, якщо його зсунути.
Формули в такому вигляді, щоб розробник реалізував їх без здогадок: вхід, вихід, межові випадки, поведінка на нулі спроб.
План калібрування на майбутнє з умовою запуску, а не «потім подивимось».