Калькулятор: экономика inference и надёжности ML в проде

Язык цифр вместо обещаний. Считает текущую стоимость inference, переплату за простой GPU, экономию на платформе Hilbert, высвобожденное время инженеров и снижение потерь от тихой деградации моделей. Все числа ваши, к прайсу Hilbert расчёт не привязан. Допущения справа можно править: модель должна выдерживать проверку финансовым директором.

Инструкция и пример
ЗАЧЕМ ЭТОТ КАЛЬКУЛЯТОР
Он переводит надёжность ML в проде на язык денег: сколько вы платите за inference сейчас, сколько из этого уходит в простой GPU, и какую годовую выгоду даёт платформа MLOps (дешевле inference, быстрее и безопаснее выкатка, автоматический мониторинг деградации). Это оценка для разговора, а не смета.

КАК ПОЛЬЗОВАТЬСЯ
1) Заполните поля сверху вниз, возле каждого есть подсказка, откуда брать число.
2) В полях стоят реалистичные значения по умолчанию, можно считать сразу.
3) Поля-допущения (оптимизация, автоматизация, сокращение срока выкатки, эффект мониторинга) это сценарные предположения. Меняйте их под свою осторожную оценку.

ОТКУДА БРАТЬ ЦИФРЫ
- Число моделей в проде: сколько ML-моделей реально обслуживают пользователей (рекомендации, поиск, прогноз, антифрод, чат-боты).
- Запросов inference в месяц: суммарно по всем моделям, в миллионах. Из логов сервинга или метрик нагрузки.
- Стоимость 1000 запросов: средняя цена inference за тысячу запросов в рублях (аренда GPU, managed-надбавка, трафик). Из счёта за инфраструктуру.
- Доля простоя GPU: какая часть оплаченного GPU-времени простаивает (типично 40 до 60 %). Из метрик утилизации.
- Срок выкатки модели: сколько дней проходит от готовой модели до прода сейчас. Из истории релизов.
- Инженеров на ручном MLOps: сколько человек заняты ручной выкаткой, мониторингом, откатами.
- Стоимость инженера: полная в месяц (оклад, налоги, содержание).
- Инцидентов деградации в год: сколько раз модель тихо просела и это ударило по метрике или потребовало срочного отката.
- Цена инцидента: средний ущерб одного инцидента (недополученная выручка, ручной разбор, откат).

ДОПУЩЕНИЯ (правьте под себя)
- Оптимизация inference: на сколько процентов платформа снижает стоимость inference (батчинг, квантизация, кэш, умный роутинг). По отрасли реально 35 до 60 %, в дефолте взято осторожные 35 %.
- Автоматизация ручного MLOps: какая доля ручного труда инженеров уходит в автоматику.
- Сокращение срока выкатки: на сколько процентов короче становится путь модели в прод.
- Эффект мониторинга: какую долю потерь от деградации снимает автоматический мониторинг и алерты.

КАК ЧИТАТЬ РЕЗУЛЬТАТ
- Стоимость inference сейчас и переплата за простой GPU: где деньги уходят сегодня.
- Inference с платформой и экономия: прямая экономия на счёте за инфраструктуру.
- Высвобождено времени инженеров и снижение потерь от деградации: непрямая, но крупная часть выгоды.
- Суммарная выгода в год: сумма трёх эффектов. Срок выкатки после платформы показывает ускорение time-to-production.

ОГОВОРКИ
- Это оценка для встречи, не финансовая гарантия. Точные числа подтверждаются на пилоте на ваших данных.
- Не учтены разовые затраты на внедрение и обучение команды. На пилоте мы считаем их отдельно.

Пример. Крупный онлайн-ритейлер: 8 моделей в проде (рекомендации, поиск, прогноз спроса, антифрод, чат-бот). 120 млн запросов inference в месяц, средняя цена 12 ₽ за 1000 запросов. Простой GPU 55 %. Выкатка модели 14 дней, 4 инженера на ручном MLOps по 350000 ₽/мес. 6 инцидентов тихой деградации в год по 1.5 млн ₽. Допущения: оптимизация inference 35 %, автоматизация 50 %, сокращение выкатки 70 %, эффект мониторинга 60 %. Текущий inference 17.28 млн ₽/год, из них 9.5 млн уходит в простой GPU. Платформа снижает inference до 11.23 млн (экономия 6.05 млн), высвобождает 8.4 млн времени инженеров, снимает 5.4 млн потерь от деградации. Срок выкатки падает с 14 до 4.2 дней. Суммарная выгода 19.85 млн ₽ в год.

Методика. Логика расчёта. Стоимость inference в год = запросов в месяц (млн) × 12 × 1000 × цена за 1000 запросов. Переплата за простой = эта стоимость × доля простоя GPU. Inference с платформой = стоимость × (1 минус оптимизация). Экономия на inference = стоимость × оптимизация. Высвобожденное время инженеров = число инженеров × стоимость × 12 × доля автоматизации. Снижение потерь от деградации = инцидентов в год × цена инцидента × эффект мониторинга. Срок выкатки после платформы = текущий срок × (1 минус сокращение). Суммарная выгода = экономия на inference плюс высвобожденное время плюс снижение потерь. Доли оптимизации, автоматизации и эффекта мониторинга это осторожные сценарные допущения, в дефолте взяты нижние границы отраслевых диапазонов 2025 до 2026. Все id полей совпадают с переменными в формулах, расчёт идёт на чистом JS в браузере.