Иллюзия точности: почему сложные математические модели топят ваш бизнес, а простые данные спасают
В 2021 году я совершил классическую ошибку инженера, дорвавшегося до больших бюджетов. Мы с командой строили систему прогнозирования спроса для региональной сети из 48 магазинов косметики. Я горел идеей сделать идеальный инструмент. Мы скормили модели всё, до чего смогли дотянуться: курсы валют, праздники, прогнозы погоды и даже парсинг упоминаний брендов в соцсетях. Архитектура выглядела потрясающе. На исторических данных точность модели приближалась к 95%. Мы праздновали победу заранее.
В первый же месяц реальной работы система предсказала закупку 14 000 флаконов корейской сыворотки на склад в Екатеринбурге. Знаете, сколько мы реально продали? 2 100 штук. Ошибка прогноза по этой категории составила дикие 43% в деньгах. Мы привезли тонны товара, который просто лег мертвым грузом на складе, заморозив миллионы оборотных средств.
Почему так вышло? Всё оказалось прозаично. За три месяца до нашего прогноза местный бьюти-блогер миллионник случайно похвалил эту сыворотку в сторис. Случился разовый, аномальный всплеск продаж. Наша сверхсложная модель приняла этот шум за устойчивый, экспоненциальный тренд. А еще выяснилось, что в ERP-системе клиента возвраты товара иногда записывались как продажи с отрицательным знаком. Математика просто сошла с ума на этих грязных данных.
Тогда я понял важную вещь. Точность прогноза в бизнесе зависит не от сложности алгоритма. Она зависит от чистоты вводных данных и здравого смысла.
Культ сложности и его жертвы
В ИТ-индустрии процветает культ сложности. Разработчикам выгодно продавать тяжелые нейросети, потому что это звучит дорого и солидно. Бизнесу приятно думать, что их процессами управляет передовой искусственный интеллект. Но на практике сложная модель на зашумленных данных работает хуже, чем обычное скользящее среднее на чистой таблице.
Когда компания заказывает ml прогнозирование для бизнеса, она часто ждет чуда. Руководитель думает: «Сейчас мы загрузим наши хаотичные таблицы за пять лет, магия алгоритмов все исправит, и мы узнаем точные продажи на следующий вторник». Это иллюзия. Магия не работает. Если ваш менеджер на складе забывает вовремя оприходовать накладные, или если в системе продаж дублируются транзакции, то любая, даже самая передовая модель выдаст вам бред. Только этот бред будет упакован в красивые, научно выглядящие графики.
Сложность — это наркотик для инженеров, но яд для бизнеса. Чем больше параметров учитывает модель, тем выше вероятность оверфиттинга — ситуации, когда алгоритм идеально подстраивается под прошлое, но абсолютно слеп перед будущим.
Как заставить цифры говорить правду
Правильный, работающий анализ данных с прогнозом начинается с безжалостной чистки базы. Нужно вручную или полуавтоматически убрать аномалии. Это те самые разовые хайпы, ковидные локдауны или периоды, когда товара просто не было на складе (из-за чего продажи упали до нуля, хотя спрос был высоким). Если не очистить историю от этих факторов, модель спрогнозирует вам катастрофу или, наоборот, нереальный взлет.
Второй важный момент — интерпретируемость. Если алгоритм выдает цифру, но никто в компании не может объяснить, почему она именно такая, этому прогнозу грош цена. Решения принимают люди, а людям нужно доверять инструменту. Именно поэтому хороший инструмент дата-анализа не должен быть черным ящиком. Он должен показывать логику. Сначала мы смотрим на очищенный исторический тренд. Затем на сезонность. И только потом накладываем математическое предсказание.
На выходе собственник или коммерческий директор должен получать не простыню из миллионов строк, а понятный отчёт с инсайтами по данным. Например: «Продажи этой группы товаров растут на 15% год к году, но в марте будет просадка из-за ранней весны. Рекомендуемый объем закупки — 5 000 единиц, вероятность дефицита при этом сценарии — всего 4%». Это язык бизнеса, а не язык дата-сайенса. Простые ориентиры всегда бьют сложные, но непонятные цифры.
Наш опыт работы с реальностью
Мы в GuardLabs наступили на все возможные грабли в этой нише. Нам надоело внедрять громоздкие системы, которые ломаются от любого чиха рынка и требуют штата аналитиков для поддержки. Поэтому мы создали решение для нормальных людей. Вы просто загружаете свой датасет, система сама чистит выбросы, строит адекватные тренды и переводит цифры на человеческий язык. Если вам нужен честный и работающий Инструмент анализа данных с ML-прогнозом без раздутого бюджета и сказок про искусственный сверхинтеллект, приходите к нам. Мы покажем, как ваши данные могут работать на вас уже сегодня.