Перейти к содержанию
Аналитический материал9 мин чтенияИсточники проверены

Токен — новая валюта ИИ? Почему цена за миллион почти ничего не говорит о ценности

Разбираем, что оплачивается в API моделей, почему вход и выход стоят по-разному и как перейти от тарифа за токен к стоимости решённой задачи.

Для: Владельцы бизнеса, руководители процессов и разработчики ИИ-систем

Токен — новая валюта ИИ? Почему цена за миллион почти ничего не говорит о ценности

Токен всё чаще выглядит единицей обмена в ИИ-экономике. Компании покупают миллионы входных и выходных токенов, разработчики считают бюджет промпта, платформы обещают скидку на кэш. Отсюда соблазн назвать токен «новой валютой». Это яркая метафора, но плохой управленческий показатель.

Токен — единица счёта работы модели. Он не равен слову, мысли, факту, минуте специалиста или полезному результату. Разные модели разбивают один и тот же текст на разное число токенов; изображения, аудио, видео и инструменты имеют собственные правила тарификации. Поэтому даже две одинаковые цены «за миллион» ещё не означают одинаковую стоимость обработки одного документа. Anthropic прямо отмечает, что новый токенизатор ряда Claude-моделей может дать примерно на 30% больше токенов для того же текста по сравнению с предыдущим, с зависимостью от материала и задачи. Источник: Anthropic (откроется в новой вкладке).

Что попадает в счёт

Простейшая формула: стоимость вызова = входные токены × ставка входа + выходные токены × ставка выхода. На практике к ней добавляются кэширование, платные инструменты, длительность хранения кэша, длинный контекст, режим скорости, регион, повторные попытки и сервисы вокруг модели. У Google, например, отдельно указаны тарифы для grounding и хранения cached context; у Anthropic различаются запись в кэш и его чтение; у OpenAI есть тарифные режимы Standard, Batch/Flex и Fast. Google (откроется в новой вкладке), Anthropic (откроется в новой вкладке), OpenAI (откроется в новой вкладке).

Выход часто существенно дороже входа. Поэтому команда, которая сократила промпт на 10%, но заставила модель писать втрое более длинные объяснения, может получить больший счёт. И наоборот: чуть более длинная инструкция, обеспечивающая короткий структурированный ответ без переписывания, может оказаться экономнее.

Стоимость токенов — один из входов; ценность определяют принятый результат и работа человека.

Почему падение цены не завершает разговор

В AI Index 2025 (откроется в новой вкладке) Stanford HAI оценил: цена запроса к модели с уровнем GPT-3.5 на MMLU снизилась более чем в 280 раз между ноябрём 2022 и октябрём 2024 года. Это важный исторический показатель удешевления конкретного уровня возможностей. Он не означает, что любой сегодняшний процесс стал дешевле в той же пропорции. Организации стали отправлять больше данных, дольше рассуждать, запускать больше инструментов и поручать моделям более сложные задачи.

Единица ценности — принятый результат

Предположим, классификация письма на маленькой модели стоит $0.002. Каждое десятое письмо требует проверки сотрудника за $0.10, а каждое двадцатое — исправления за $0.20. Средняя переменная стоимость становится $0.002 + 0.10×$0.10 + 0.05×$0.20 = $0.022 на письмо. Модельный вызов составляет менее десятой части этой суммы. Цифры гипотетические, принцип вполне практический.

Хороший показатель: полная стоимость принятого результата. В числителе — вызовы моделей, инструменты, проверки, исправления и доля фиксированных затрат; в знаменателе — результаты, прошедшие заранее заданный критерий качества. Рядом нужно показывать задержку, тяжёлые ошибки, долю ручных исключений и удовлетворённость пользователя. Низкая стоимость бесполезного ответа не является эффективностью.

Как изменить бюджетирование

Начните с одного процесса: например, извлечения полей из счетов, черновиков ответов клиентам или анализа договоров. Запишите распределение размера входа и выхода, долю кэш-попаданий, число повторов, стоимость работы человека и критерий приемки. Сравните модели на одних и тех же реальных случаях. Фиксируйте не только среднюю, но и 90-й или 95-й процентиль стоимости: исключения могут определять экономику.

Почему единица тарификации не становится единицей ценности

Стоимость токена похожа на цену минуты облачного сервера или страницы OCR: она описывает расход одного компонента. Компания же покупает способность выполнить работу. Между расходом и результатом стоит цепочка: получение исходных данных → подготовка контекста → вызов модели → проверка → действие → наблюдение за последствиями. Экономика цепочки определяется самым слабым звеном. Если сотрудник всё равно перечитывает каждый исходный документ, точный, но непрозрачный ответ может почти не экономить время. Если система уверенно ошибается в редких дорогих случаях, средняя стоимость вызова скрывает риск.

Важно различать предельную стоимость очередного обращения и полную стоимость владения. Предельная включает переменные тарифы и работу с конкретным случаем. Полная добавляет проектирование, интеграцию, создание тестового набора, поддержку, управление доступом, пересмотр промптов и переобучение команды. Пилот может выглядеть прибыльным при малом объёме, если не учитывать фиксированные вложения; крупная эксплуатация может стать дорогой из-за роста исключений. Эти затраты нужно распределять на разумный горизонт и ожидаемый объём, а не прятать в категории «внедрение уже оплачено».

Экономика относительно альтернативы

ИИ-система не создаёт экономию просто потому, что выполнила действие. Нужно сравнить её с тем, как работа выполнялась бы без неё: сотрудником, обычным правилом, шаблоном, поиском или отказом от ненужного шага. Базовая линия должна использовать тот же критерий качества и включать те же сложные случаи. Иначе ускорение получается искусственным: ИИ проверяют на простых заявках, а человека — на полном потоке.

Исследование Generative AI at Work (откроется в новой вкладке) на работе специалистов клиентской поддержки показывает, почему этот контекст важен. Авторы обнаружили рост производительности в изученной организации, но эффект был существенно выше у менее опытных сотрудников и слабее у опытных. Это не обещание аналогичного процента в другой компании. Это свидетельство того, что ценность зависит от состава команды, характера задач и того, как инструмент передаёт лучшие практики.

Эксперимент «jagged technological frontier» (откроется в новой вкладке) добавляет ещё одну оговорку: способность ИИ неоднородна даже в пределах похожей профессиональной работы. Задача может лежать по одну сторону «границы возможностей», соседняя — по другую. Поэтому экономику следует строить не на среднем «ИИ ускоряет аналитика», а на карте конкретных операций: где он надёжен, где помогает черновиком и где пока увеличивает риск.

Минимальная модель unit economics

Для каждой категории случаев заведите отдельную строку: частота, базовое время человека, доля автоматического принятия, доля проверки, стоимость исправления, цена инструментов и модельных вызовов, тяжесть ошибки. Затем задайте три сценария: обычный поток, всплеск объёма и изменение структуры запросов. Модель, которая выгодна только при идеальном кэшировании и отсутствии исключений, слабо подходит для планирования.

Финансовый эффект может быть разным: снижение оплачиваемых часов, возможность обработать больший объём без роста штата, сокращение ожидания клиента, уменьшение ошибок или высвобождение времени эксперта для сложной работы. Не складывайте эти эффекты автоматически: если сотрудник тратит освобождённое время на проверку ответа, экономия времени и повышение качества могут описывать один и тот же ресурс. Назовите, какой эффект действительно реализуем в организации.

Полезно также оценить ценность отказа. Иногда система должна сказать: «доказательств недостаточно, передайте специалисту». Такой исход тратит токены, но может предотвратить дорогую ошибку. Если метрика награждает только полностью автоматические ответы, команда невольно стимулирует модель выдавать ответ там, где она должна остановиться.

Сквозной пример: входящие обращения магазина

Представим растущий магазин с вопросами о доставке, возвратах и изменении заказов. Сегодня сотрудник читает письмо, ищет статус заказа, сверяет политику, отвечает и иногда меняет запись в системе. Предложение «подключить ИИ для ответов» слишком широко для расчёта. Разделим поток на категории. Вопрос о сроке доставки с известным статусом — регулярный и проверяемый. Спор о возврате после исключения из правил требует интерпретации и одобрения. Изменение адреса после передачи заказа перевозчику требует действия в нескольких системах и может быть необратимым.

Для каждой категории нужно описать результат, а не вызов модели. Например: «клиент получил корректный ответ с актуальным статусом и ссылкой на действующее правило без повторного обращения». Тогда появляется проверяемая единица для бюджета. У вопроса о возврате результат иной: «подготовлена рекомендация с указанием спорных фактов, и решение принял уполномоченный сотрудник». Полная автоматизация не требуется для того, чтобы система создавала ценность.

На пилоте заведите журнал случая. Он хранит категорию, источники, выбранную модель и версию, число инструментальных вызовов, фактическое потребление, проверку человеком, исправление, время до закрытия и итог клиента. Через несколько недель группируйте случаи по причинам затрат. Если большинство расходов приходится на поиск статуса, смена языковой модели не решит задачу; требуется лучший доступ к данным. Если расходы растут от длинных черновиков, поможет формат ответа. Если дорога проверка спорных возвратов, надо улучшить правило эскалации и пакет доказательств для сотрудника.

Такой журнал позволяет построить кривую чувствительности. Что будет, если объём обращений вырастет, доля сложных случаев изменится, поставщик повысит цену, кэш перестанет срабатывать или сотрудники начнут исправлять больше ответов? Не требуется точно предсказать каждую переменную. Достаточно увидеть, какая из них определяет результат и где нужен ограничитель. Экономика устойчивого процесса должна переживать разумное отклонение от идеального пилота.

Где считать выгоду, а где — только потенциал

В отчёте полезно разделять четыре величины: наблюдаемое сокращение активного времени сотрудника; реально высвобождённую мощность команды; улучшение клиентского результата; денежный эффект. Они связаны, но не равны. Если среднее письмо стало готовиться быстрее, а сотрудник по-прежнему должен быть на смене, это может означать большую пропускную способность или меньшую очередь, но не прямое сокращение фонда оплаты труда. Если качество ответа повысилось, денежная оценка потребует отдельной связи с удержанием клиента или повторными обращениями.

Не следует обнулять стоимость знаний сотрудников. Эксперты создают и обновляют правила, которыми пользуется система, разбирают исключения и обучают новичков. Успех ИИ может переносить их работу из ответов на типовые письма в обслуживание базы знаний и контроль качества. Это может быть прекрасным результатом, но бюджет должен показывать новую работу явно.

Так «новая валюта» становится более точной метафорой: организация обменивает вычисление, данные и человеческое внимание на надёжную выполненную работу. Токен — один из измерителей этого обмена, а не его окончательная цена.

Как составить бюджет, который не устареет при смене модели

Разделите бюджет на объём работы и цену обработки. Объём — сколько случаев каждого типа ожидается, как часто понадобятся инструменты, какова доля сложных исключений. Цена обработки — фактическое потребление токенов, тарифы, время проверки и стоимость исправления. Тогда при смене провайдера можно обновить тарифы и профиль токенизации, не переписывая всю логику бизнес-кейса. При изменении спроса — поменять смесь случаев, не притворяясь, что все письма одинаковы.

Отдельно учитывайте тарифный режим. Пакетная обработка может подойти для ночной сортировки документов, но не для ответа клиенту в живом диалоге. Кэш может удешевить повторяемые инструкции, но его эффект зависит от стабильности входа. Длинный контекст и специальные инструменты могут иметь другой тариф. Подписка сотрудника на чат-сервис не эквивалентна API-интеграции с журналом, доступами и ограничителями. Эти продукты могут быть полезны для разных этапов работы, но их стоимость нельзя свести к одной строке «цена ИИ».

В прогнозе держите пол, базу и стресс. Пол — нижняя граница при идеальном выполнении: минимальное число вызовов без исправлений. База — наблюдаемое поведение после пилота. Стресс — сложный период: больше нестандартных заявок, ниже кэш-попадания, выше доля ручных проверок. Не надо угадывать точную будущую цену каждой модели. Нужно понять, выдерживает ли процесс разумное ухудшение условий и где система должна остановить дорогую цепочку.

Экономическую оценку сопровождайте не только денежным итогом, но и ограничениями применимости. Если в пилоте были только письма на английском, нельзя обещать тот же эффект на португальском или русском. Если эксперт проверял ответы сразу, нельзя переносить время закрытия на реальную очередь. Если использовали исторические данные без последующего изменения политики, оценка не отражает обслуживание после запуска. Честно описанные границы исследования делают решение более надёжным, чем точная на вид, но непрозрачная цифра окупаемости.

Наконец, цена ошибки часто нелинейна. Десять неверных приветствий и один неверный возврат не равны одиннадцати одинаковым дефектам. Для категорий с высокими последствиями задайте предел риска и процедуру ручного решения до расчёта экономии. Только в допустимой области сравнивайте варианты по затратам. Такой порядок защищает бизнес от соблазна обменять редкую дорогую ошибку на небольшую среднюю экономию.

Вывод: токен полезен как счётчик потребления. Экономическая «валюта» ИИ-системы — проверенный результат в нужный срок и с допустимым риском.

Далее: Сколько стоит контекст.

Источники

Начните с процесса

Обсудить ваш процесс

Опишите один workflow, его входы, внешние действия и цену ошибки. Мы определим минимальный уровень автономности, который безопасно проверять.