Компании столкнулись с проблемой непредсказуемых расходов на ИИ

В начале 2026 года многие компании призывали сотрудников активнее использовать искусственный интеллект в рабочих процессах. На этом фоне появился термин tokenmaxxing, описывающий стремление максимально расходовать доступные ИИ-ресурсы. В некоторых случаях сотрудники даже поручали моделям бессмысленные задачи, чтобы формально выполнить установленные нормы.

Однако после получения первых счетов за использование ИИ компании стали осторожнее подходить к масштабированию таких инструментов. Выяснилось, что даже при наличии четких тарифов спрогнозировать реальные расходы на ИИ бывает значительно сложнее, чем кажется.

Большинство компаний ошибаются при расчете бюджета

Согласно недавнему исследованию, только 11% примерно 400 опрошенных компаний смогли точно спрогнозировать свои расходы на искусственный интеллект.

Еще 13% организаций ошиблись почти на 50%. У 39% расхождение между прогнозом и фактическими затратами составило от 11% до 25%, а у 35% — от 26% до 50%.

Таким образом, для большинства компаний проблема заключается не столько в высокой стоимости отдельных запросов к ИИ, сколько в сложности оценки общего объема работы, который модели будут выполнять в реальных бизнес-процессах.

Более дешевая модель не всегда обходится дешевле

Одной из причин такой неопределенности является характер работы современных ИИ-моделей. В отличие от традиционного программного обеспечения, они могут решать одну и ту же задачу совершенно разными способами.

Модель может допустить ошибку, выбрать неэффективный алгоритм действий, несколько раз повторить неудачную операцию или потратить большое количество токенов на задачу, которую другая модель решит значительно быстрее.

Это подтвердил эксперимент исследователей Стэнфордского университета, Университета Карнеги-Меллона, Калифорнийского университета в Беркли и Microsoft Research. Ученые протестировали различные ИИ-модели на 6800 задачах, связанных с математикой, программированием, естественными науками и другими направлениями.

В 32% случаев использование моделей с более низкой стоимостью за отдельный запрос в итоге обходилось дороже, чем работа с более дорогими альтернативами.

Поэтому стоимость одного токена или отдельного запроса не позволяет напрямую определить итоговую цену выполнения конкретной задачи.

Дешевый Gemini может потратить в 14 раз больше

Один из показательных экспериментов провели с двумя моделями Google — более дорогой Gemini 3.1 Pro и более доступной Gemini 3 Flash. Им предложили проанализировать кадр из видео на YouTube.

Gemini 3.1 Pro справилась с заданием после примерно 85 действий. Стоимость использованных токенов составила около $1.

Gemini 3 Flash, несмотря на более низкую цену, действовала значительно дольше. Модель выполнила почти 1000 операций и потратила около $14 на токены, при этом так и не смогла завершить поставленную задачу.

Таким образом, разница в цене самого ИИ-запроса оказалась менее важной, чем эффективность модели при решении конкретной задачи.

Компании пока не могут точно предсказать расходы

Исследователи отмечают, что при оценке стоимости ИИ необходимо учитывать не только тарифы поставщика, но и поведение самой модели. Чем сложнее задача и чем больше автономных действий требуется для ее выполнения, тем сильнее итоговые расходы могут отличаться от первоначального прогноза.

Линцзяо Чен, один из авторов исследования, отмечает, что ориентироваться исключительно на цену модели недостаточно: более низкая стоимость использования не обязательно означает более низкие расходы на выполнение конкретной работы.

В Google, в свою очередь, признают, что определенные различия в поведении моделей неизбежны. Представитель компании отметил, что при большом количестве разнообразных рабочих задач отдельные отклонения в среднем сглаживаются, однако итоговая стоимость конкретной операции по-прежнему зависит от множества факторов.

Для бизнеса это означает необходимость оценивать ИИ не только по цене отдельных токенов, но и по тому, насколько эффективно модель справляется с реальными задачами. В противном случае попытка сэкономить на более дешевой модели может привести к обратному результату — большему количеству действий, более высокому расходу вычислительных ресурсов и, в итоге, более дорогому выполнению работы.

Оставить комментарий