демо-стенд · модель оцінювання

Одне число, на яке людина ставить гроші: де «відсоток правильних» бреше і чим його замінюють

Стенд про клас задачі «оцінка готовності 0–100 за банком завдань з предметними областями різної ваги». Дані на стенді — синтетичні профілі, порахованi однією і тією ж арифметикою для всіх рядків. Це не ваші користувачі й не ваша модель: ваша модель розбирається на етапі роботи, тут показано, ЩО саме перевіряється і як виглядає різниця.

01Чотири місця, де така оцінка ламається тихо

Тихо — тобто число виглядає розумним, ніхто не бачить помилки, а людина записується на платний іспит зарано або зарано лякається.

Мало відповідей = висока впевненість

Відповів на 12 завдань, усі правильно — «100». Наївний відсоток не відрізняє 12 відповідей від 400, хоча це два різних світи за надійністю.

Вибір завдань не випадковий

Людина сама тягне те, що їй легше. Відсоток правильних тоді міряє смак у виборі завдань, а не готовність.

Ваги областей з іспиту не перенесені в оцінку

Сильна область з малою вагою витягує число вгору, а провал у важкій області з великою вагою в ньому майже не чути.

Шкала 0–100 нічому не відповідає

Поки немає даних про складені іспити, «80» — це не «80% шансів скласти». Число можна тільки впорядковувати, а не читати як ймовірність. Це треба або сказати користувачеві, або перестати бути правдою.

02Ті самі люди, два способи порахувати

П'ять синтетичних профілів на банку з 520 завдань і трьох областях з вагами 0.45 / 0.35 / 0.20. Ліва колонка — наївний відсоток правильних. Права — оцінка, що враховує обсяг відповідей, ваги областей і власну невизначеність.

ПрофільВідповідейНаївний %Обережна оцінкаРізниця
Швидкий оптиміст36 правильних з 40, майже все — з найлегшої області 40 з 520 90 57 −33
Дуже мало даних12 з 12 правильних 12 з 520 100 54 −46
Діра у найважчій областісильний у двох легких, 9 з 15 у області з вагою 0.45 235 з 520 83 64 −19
Рівномірна підготовкаохоплені всі три області пропорційно 300 з 520 72 66 −6
Повний прохід банкупройдено майже все, результат стабільний 511 з 520 69 65 −4
Читати так: чим менше даних і чим кривіше вони розподілені по областях, тим більша різниця. Там, де людина реально пройшла банк, обидва способи майже сходяться — і це ознака, що модель не «псує» чесні випадки.
Головне не в тому, що друге число менше. Головне — що воно перестає рости від однієї легкої серії і падає саме там, де людина ще не бачила важкої частини іспиту. Останні два рядки показують межу: коли даних досить, корекція майже зникає — інакше модель просто б занижувала всіх.

03Три механізми, якими це робиться

  1. Стягування малих вибірок до апріорного рівня. Оцінка по області рахується не як «правильні / спроби», а з урахуванням апріорного припущення. 4 з 4 перестає означати «стовідсотково»: сила стягування — параметр, який підбирається під ваш банк і рівень ваших користувачів.
  2. Ваги областей з реального іспиту. Підсумок — зважена комбінація по областях, а не загальний відсоток. Тоді провал у важкій області видно в числі, а не лише у внутрішній статистиці.
  3. Поправка на власну невизначеність. Оцінка публікується консервативно: чим ширший інтервал довіри (мало відповідей, нерівне охоплення), тим більший відступ від середнього. Розмір відступу — другий параметр, і саме він задає, наскільки система обережна з чужими грошима.

Обидва параметри мають зрозумілий сенс і одну чітку роль. Що вони мають бути саме такими — не віра, а результат порівняння на спільному наборі сценаріїв: та сама таблиця, тільки на ваших областях, вагах і ваших реальних розподілах спроб.

04Що змінюється, коли з'являться дані про складені іспити

Доки немає жодного відомого результату справжнього іспиту, будь-яка «ймовірність скласти» — вигадка. Тому калібрування закладається як окремий етап, який запускається пізніше і нічого не ламає:

05Що буває на виході такої роботи