Язык цифр вместо обещаний. Считает текущую стоимость inference, переплату за простой GPU, экономию на платформе Hilbert, высвобожденное время инженеров и снижение потерь от тихой деградации моделей. Все числа ваши, к прайсу Hilbert расчёт не привязан. Допущения справа можно править: модель должна выдерживать проверку финансовым директором.
ЗАЧЕМ ЭТОТ КАЛЬКУЛЯТОР Он переводит надёжность ML в проде на язык денег: сколько вы платите за inference сейчас, сколько из этого уходит в простой GPU, и какую годовую выгоду даёт платформа MLOps (дешевле inference, быстрее и безопаснее выкатка, автоматический мониторинг деградации). Это оценка для разговора, а не смета. КАК ПОЛЬЗОВАТЬСЯ 1) Заполните поля сверху вниз, возле каждого есть подсказка, откуда брать число. 2) В полях стоят реалистичные значения по умолчанию, можно считать сразу. 3) Поля-допущения (оптимизация, автоматизация, сокращение срока выкатки, эффект мониторинга) это сценарные предположения. Меняйте их под свою осторожную оценку. ОТКУДА БРАТЬ ЦИФРЫ - Число моделей в проде: сколько ML-моделей реально обслуживают пользователей (рекомендации, поиск, прогноз, антифрод, чат-боты). - Запросов inference в месяц: суммарно по всем моделям, в миллионах. Из логов сервинга или метрик нагрузки. - Стоимость 1000 запросов: средняя цена inference за тысячу запросов в рублях (аренда GPU, managed-надбавка, трафик). Из счёта за инфраструктуру. - Доля простоя GPU: какая часть оплаченного GPU-времени простаивает (типично 40 до 60 %). Из метрик утилизации. - Срок выкатки модели: сколько дней проходит от готовой модели до прода сейчас. Из истории релизов. - Инженеров на ручном MLOps: сколько человек заняты ручной выкаткой, мониторингом, откатами. - Стоимость инженера: полная в месяц (оклад, налоги, содержание). - Инцидентов деградации в год: сколько раз модель тихо просела и это ударило по метрике или потребовало срочного отката. - Цена инцидента: средний ущерб одного инцидента (недополученная выручка, ручной разбор, откат). ДОПУЩЕНИЯ (правьте под себя) - Оптимизация inference: на сколько процентов платформа снижает стоимость inference (батчинг, квантизация, кэш, умный роутинг). По отрасли реально 35 до 60 %, в дефолте взято осторожные 35 %. - Автоматизация ручного MLOps: какая доля ручного труда инженеров уходит в автоматику. - Сокращение срока выкатки: на сколько процентов короче становится путь модели в прод. - Эффект мониторинга: какую долю потерь от деградации снимает автоматический мониторинг и алерты. КАК ЧИТАТЬ РЕЗУЛЬТАТ - Стоимость inference сейчас и переплата за простой GPU: где деньги уходят сегодня. - Inference с платформой и экономия: прямая экономия на счёте за инфраструктуру. - Высвобождено времени инженеров и снижение потерь от деградации: непрямая, но крупная часть выгоды. - Суммарная выгода в год: сумма трёх эффектов. Срок выкатки после платформы показывает ускорение time-to-production. ОГОВОРКИ - Это оценка для встречи, не финансовая гарантия. Точные числа подтверждаются на пилоте на ваших данных. - Не учтены разовые затраты на внедрение и обучение команды. На пилоте мы считаем их отдельно.
Пример. Крупный онлайн-ритейлер: 8 моделей в проде (рекомендации, поиск, прогноз спроса, антифрод, чат-бот). 120 млн запросов inference в месяц, средняя цена 12 ₽ за 1000 запросов. Простой GPU 55 %. Выкатка модели 14 дней, 4 инженера на ручном MLOps по 350000 ₽/мес. 6 инцидентов тихой деградации в год по 1.5 млн ₽. Допущения: оптимизация inference 35 %, автоматизация 50 %, сокращение выкатки 70 %, эффект мониторинга 60 %. Текущий inference 17.28 млн ₽/год, из них 9.5 млн уходит в простой GPU. Платформа снижает inference до 11.23 млн (экономия 6.05 млн), высвобождает 8.4 млн времени инженеров, снимает 5.4 млн потерь от деградации. Срок выкатки падает с 14 до 4.2 дней. Суммарная выгода 19.85 млн ₽ в год.
Методика. Логика расчёта. Стоимость inference в год = запросов в месяц (млн) × 12 × 1000 × цена за 1000 запросов. Переплата за простой = эта стоимость × доля простоя GPU. Inference с платформой = стоимость × (1 минус оптимизация). Экономия на inference = стоимость × оптимизация. Высвобожденное время инженеров = число инженеров × стоимость × 12 × доля автоматизации. Снижение потерь от деградации = инцидентов в год × цена инцидента × эффект мониторинга. Срок выкатки после платформы = текущий срок × (1 минус сокращение). Суммарная выгода = экономия на inference плюс высвобожденное время плюс снижение потерь. Доли оптимизации, автоматизации и эффекта мониторинга это осторожные сценарные допущения, в дефолте взяты нижние границы отраслевых диапазонов 2025 до 2026. Все id полей совпадают с переменными в формулах, расчёт идёт на чистом JS в браузере.