Как устроена токеномика — экономика мира ИИ

Долгое время разработчики жили в парадигме «закон Мура все исправит, а применительно для ИИ сделает вычисления вообще бесплатными». Серьезный сдвиг в ИТ-индустрии, произошедший на рубеже 2025–2026 годов показал нечто иное. Благодаря прошлому опыту разработчики ПО привыкли к тому, что масштабировать цифровой продукт относительно легко: вы пишете код один раз, а затраты на каждого нового пользователя падают почти до незначительных затрат. В мире генеративного ИИ все уперлось в физическую и экономическую стоимость каждого отдельного токена, а их расход по ряду причин оказался очень далек от оптимального.
В эпоху генеративных моделей токен превратился в универсальную меру вычислений, точный аналог «киловатт-часа» для энергетика или «кубометра газа» для промышленника. Это фундаментальная расчетная единица, которая связала стоимость видеокарт, гигаватты электричества, многомиллионные инвестиции и строчки текста, которые получают пользователи.
И она отличается от того, к чему мы привыкли. Если в классической SaaS-модели стоимость обслуживания каждого последующего пользователя уменьшается, то в мире LLM стоимость запроса почти не меняется, а с большими объемами начинает расти.
Чтобы понять, как устроена эта «банковская система» цифровой эпохи, почему одни «буквы» стоят дороже других и что оптимальнее — корпоративный сервер или подписка на облачный сервис или серверная стойка, нам придется спуститься на уровень базовой логики работы ИИ и разобрать анатомию ее работы применительно к затратам.
Дисклеймер:
Само слово «токеномика» появилось для описания блокчейна, смарт-контрактов, майнинга, листинга на биржах и Web3. В этой статье всего этого не будет. В современной бизнес-литературе термин AI Tokenomics преимущественно используется для обозначения управления затратами и инфраструктурой для систем искусственного интеллекта (FinOps).
Почему старая ИТ-экономика сломалась об ИИ
Любая новая практическая дисциплина (в том числе и в ИТ-индустрии) формируется лишь тогда, когда множество нерешаемых проблем натыкается на неприменимость старых инструментов. FinOps появился из-за усложнения облачных технологий, и по этой же причине токеномика сейчас формируется как отдельная дисциплина, объединяя архитектуру нейросетей, ограничения кремниевых чипов и облачную экономику.
Масштабирование генеративных продуктов по модели классической веб-разработки провалилось по трем причинам:
-
Смена типа «операционного рычага» (High Operating Leverage на Low Operating Leverage). У традиционного софта серверные обращения к базам данных почти ничего не стоят, поэтому маржинальность бизнеса растет вместе с базой клиентов. Запрос в LLM запускает тяжелые математические вычисления на GPU. Затраты на инфраструктуру растут линейно вслед за аудиторией. Из-за этого чистая маржинальность компаний, плотно работающих на ИИ-технологиях (AI-first компании), рухнула до 50–60% по сравнению с 80–90% у классического SaaS.
-
Физический тупик кремния. Видеокарты в дата-центрах уперлись в пропускную способность памяти. Скорость их ответов упирается в передачу данных из памяти в вычислительные ядра.
-
Отсутствие предсказуемости в агентных системах. На одну задачу пользователя агент совершит десятки скрытых итерационных вызовов модели. Он запланирует шаги, обратится к базам данных и примется исправлять свои ошибки. А еще есть риск зацикливания, которое может выработать за раз весь установленный лимит токенов.
Этим изменениям требуются новые понятийный аппарат.
Краткий словарь юного токеномиста
Для описания работы современных LLM нужен универсальный знаменатель, который свяжет экономику и физику вычислений. Такая роль досталась токену.
Давайте зафиксируем его определение вместе с другими важными понятиями.
Токен (Token) — единица обработки текста в современных языковых моделях, которая возникает на этапе предварительного разбиения данных с помощью алгоритмов Byte Pair Encoding (BPE) или SentencePiece. Если для английского текста один токен соответствует примерно 3–4 символам, то из-за сложной морфологии кириллицы это значение будет еще меньше. Этот скрытый «кириллический налог» увеличивает базовую стоимость инференса для русского языка.
Инференс (Inference) — процесс работы уже обученной нейросети, когда она принимает реальный запрос от пользователя и вычисляет ответ. Инференс осуществляется на серверах круглосуточно, выступая главным источником операционных расходов ИИ-продуктов.
TTFT (Time to First Token) и TPT (Time Per Token) — это ключевые метрики инференса. TTFT определяется скоростью обработки входного промпта и показывает задержку между отправкой запроса и выдачей первого токена. TPT зависит от пропускной способности памяти GPU и показывает скорость генерации токенов.
Входные токены (Input / Prompt Tokens, Ti) — исходный массив текстовых или мультимодальных данных, который пользователь или внешняя программная обвязка отправляют непосредственно в модель. Сюда же входят скрытые системные инструкции, промпты для агентов и переменными окружения.
Контекстные токены (Context Tokens, Tc) включают историю текущего диалога и документы, нужные пользователю внутри активного контекстного окна модели в процессе взаимодействия. Этот тип токенов требует максимальной вычислительной мощности, так как видеокарты обсчитывают историю при каждом последующем шаге. Чтобы на длинных диалогах производительность не деградировала, инженеры вынуждены внедрять оптимизацию стоимости инференса через KV-Cache.
Выходные токены (Output / Generation Tokens, To) представляют собой результат работы авторегрессионного инференса, генерируются моделью последовательно, возвращаясь в пользовательский интерфейс по одному за раз. Из-за ограничение пропускной способностью памяти, выходные токены остаются самым самый дорогим типом токенов на рынке.
Скрытые токены / токены рассуждения (Hidden Reasoning / Thinking Tokens, Th) расходуются на промежуточные вычислительные цепочки режима внутреннего монолога (Chain-of-Thought). Облачные провайдеры взимают тарифицируют их в полном объеме как стандартные выходные токены. В сложных задачах на логику из-за них приходится закладывать дополнительные бюджеты.
Кеширование контекста (Context / Prompt Caching, Tc) — технология, которая позволяет избегать тяжелых повторных расчетов системных инструкций. При ней вычисленные математические состояния (активации) статичных фрагментов промпта сохраняются в высокоскоростной памяти сервера. Провайдеры поощряют использование этого инструмента, предоставляя B2B-клиентам скидки от 50 до 90% на повторные prefill-операции.
Кеш ключей и значений (KV-Cache) — динамическая структура данных в высокоскоростной видеопамяти (VRAM/HBM), в которой для токенов фиксируются промежуточные состояния внимания (Attention). Без KV-Cache модель не сможет создавать текст последовательно, так как ей для генерации каждого последующего слова пришлось бы бы пересчитывать всю историю диалога с нуля.
«KV-ожирение» (KV-Cache Bloat) — разрастание KV-Cache при работе с длинными контекстными окнами (от 128k токенов и выше), которое может вызвать критическую ошибку нехватки памяти. Избежать этой проблемы можно алгоритмами квантования кеша (KV Quantization) или постраничным обменом данных.
«Агентский налог» (Agentic Tax) — нелинейный рост потребления вычислительных ресурсов из-за запуска агентом цикла из десятков скрытых вызовов моделей, RAG-запросов к базам данных и проверок скомпилированного кода.
Квантование (Quantization) — самый популярный и коммерчески эффективный способ оптимизации, при котором точность числовых весов модели снижается, например, из исходного 16-битного формата (FP16) в 8-битный (INT8) или даже 4-битный (INT4). Квантование позволяет запускать тяжелые корпоративные модели на потребительских видеокартах или недорогих облачных серверах.
Прунинг (Pruning) — очистка нейросети от связей или целых нейронных слоев, которые практически не влияют на финальный результат вычислений. Прининг уменьшает количество необходимых математических операций (FLOPs) на каждый токен и снижает энергопотребление при инференсе.
Почему токены стоят по-разному
В прайсах крупных API-провайдеров в глаза сразу бросается разница в цене разных типов токенов. Выходные всегда дороже входных в 3–5 раз, что определяется архитектурой трансформеров. Входные данные модель обрабатывает параллельно, максимально загружая процессор, а выходные генерирует последовательно, упираясь в пропускную способность HBM-памяти.
Инференс любой языковой модели на две фазы с разным типом нагрузки.
Параллельная обработка контекста (Prefill)
На этом этапе модель принимает весь массив входных токенов и рассчитывает их внутренние математические представления за один параллельный проход (Forward Pass). Нагрузка напрямую зависит от длины запроса:
Короткий промпт (до нескольких тысяч токенов). В этом сценарии фаза prefill работает в режиме Compute-Bound. Матричные умножения выполняются параллельно на всех доступных тензорных ядрах видеокарты, обеспечивая максимальную утилизацию (ALU Utilization) кремния.
Длинный контекст (десятки тысяч токенов, RAG-выборки, книги). В классическом механизме внимания алгоритм сопоставляет каждый токен со всеми остальными, поэтому с ростом объема входящих данных возникает режим ограничения памятью и дорогой ускоритель начинает простаивать. При перезаписи больших объемов данных для формирования матриц KV-Cache в шине памяти возникает задержка (latency).
На этом этапе облачные провайдеры могут снизить свои расходы с помощью кеширования контекста. Именно поэтому prefill-тарифы для кешированных данных падают на 50–90%.
Авторегрессионная генерация (Decode)
После завершения этапа Prefill модель переходит к посимвольной выдаче ответа. Современные языковые модели опираются на авторегрессионную архитектуру, поэтому вычисляют строго по одному токену за шаг, используя результат предыдущей итерации в качестве входных данных для следующего цикла.
Для генерации выходного токена графический процессор:
-
Считывает веса. Для этого он переносит весь массив параметров модели из HBM или VRAM в регистры вычислительных ядер , который для тяжелых enterprise-систем может включать сотни миллиардов весов.
-
Загружает контекст, прогоняя через шину данных весь накопленный на предыдущих шагах KV-Cache.
-
Обновляет память. Выполняет матричные вычисления и возвращает во VRAM измененный вектор контекста, увеличившийся на один свежий токен.
По классической модели производительности Roofline Model Decode демонстрирует крайне низкая арифметическая интенсивность. Из-за нее тензорные ядра GPU большую часть времени работают с низкой утилизацией. Они завершают микровычисления за наносекунды, после чего ждут, пока подсистема памяти доставит следующую порцию весов и KV-Cache по шине данных.
Экономика инференса на примере локальных вычислений
Квантованные малые языковые модели (например, Llama-3-8B с 8 млрд параметров) целиком помещается в локальную видеопамять (VRAM) одной видеокарты. Высокая пропускная способностью встроенной шины данных (около 500–900 ГБ/с) позволяет практически мгновенно доставить восемь миллиардов параметров в вычислительные ядра. Скорость генерации в таком сценарии составит около 50–70 токенов в секунду (TPS), а коэффициент полезной загрузки ядер будет максимальный.
Размер больших языковых моделей (например, Llama-3-70B с 70 млрд параметров) будет больше объема VRAM стандартной пользовательской видеокарты. Когда система пытается прогнать все параметры через DDR5, у которой пропускная способность всего 60–80 ГБ/с, скорость генерации предсказуемо падает до 1–2 токенов в секунду. Мощный центральный процессор и дорогой графический чип работают с полезной загрузкой всего в 2%, поскольку физическая скорость системной шины жестко лимитирует всю систему.
Облачные провайдеры сталкиваются с этим бутылочным горлышком в гораздо большем масштабе. На этапе Decode кластеры из сотен ускорителей Nvidia H100/H200 или Blackwell B200 работают в режиме жесткого ограничения пропускной способности памяти. В итоге слабая загрузка вычислительных блоков чипа при авторегрессионной генерации повышает цену выходных токенов.
Из чего складывается итоговый тариф на токены
Финальная стоимость вычислений складывается из четырех жестких экономических факторов:
1. Капитальные затраты (CapEx)
На видеокарты уходит только часть первоначальных вложений. Основные затраты идут на проектирование и сборку серверных стоек, и тут на итоговую цену токена начинают влиять:
-
Стоимость вычислительных узлов. Архитектура Nvidia Blackwell B200 и серверные системы NVL72 подразумевают упаковку в одну стойку 18 серверов, содержащих в общей сложности 72 графических процессора B200, объединенных с 36 процессорами Grace CPU. Общая цена такой стойки будет 3–4 миллионов долларов, что требует достаточно большой стартовый капитал.
-
Высокоскоростной интерконнект. Крупные модели не влезают в объем памяти одиночного ускорителя, поэтому инженерам приходится объединять сотни плат в единый распределенный вычислительный массив. 20–30% от общей стоимости серверного оборудования уходит на на сетевые коммутаторы, специализированные адаптеры и оптические линии связи. Без них Decode замедляется из-за сетевых задержек между картами.
2. Амортизация
Обычное серверное оборудование меняется примерно раз в четыре года. ИИ-ускорители морально устаревают за три года (иногда эксперты говорят даже о горизонте полутора-двух лет) и становится нерентабельными. Провайдеры рассчитывают тарифы так, чтобы полностью вернуть свои вложения за этот период и вывести старое оборудование из эксплуатации, так как у новых решений выше энергоэффективность и пропускная способность.

3. Операционные затраты (OpEx)
Для примера возьмем Nvidia Blackwell GB200 NVL72, которая требует около 120–130 кВт энергии вместо 7–10 кВт у стандартной облачной стойки.
Для оператора дата-центра эти цифры будут еще больше, так как ему надо сначала запитать оборудование, а затем отвести тепло. Локальные тарифы на электроэнергию начинают влиять на цену токена.
Еще операционные затраты включают расходы на аренду пространства внутри дата-центра уровня Tier III/IV, резервирование линий питания и оплату исходящего интернет-трафика.
4. Коэффициент утилизации (GPU Utilization)
Затраты на амортизацию и охлаждение серверной стойки идут непрерывно, а вот плотность пользовательских запросов в течение дня может меняться. Финальная финансовая эффективность ИИ-платформы зависит от непрерывности загрузки ее мощностей, который определяется распределением бизнес-активности. Пик приходится на рабочие часы, а ночью оборудование простаивает. Если полезная загрузка ядер за сутки падает до 40%, то себестоимость генерации каждого токена возрастает более чем в два раза.
Для оптимизации загрузки ведущие вендоры вводят пакетные асинхронные интерфейсы (Batch API). Если задачу можно выполнить ночью (например, провести разовый анализ документов или разметить датасет), то провайдер дает фиксированную скидку в 50%. Это позволяет ему утилизировать простаивающие ночные мощности, распределяя фиксированные издержки на амортизацию по большему объему вычисляемых токенов.
Цена выработанного электричества составляет только малую часть себестоимости токена. Итоговый тариф складывается из стартовых CapEx-инвестиций, затрат на модернизацию железа и коэффициента утилизации, которого смогли добиться инженеры. Но все эти расчеты и инфраструктурные ограничения характерны для классических «плотных» (Dense) трансформеров, в ограничения которых индустрия уже уперлась. Бесконечно наращивать объем высокоскоростной памяти HBM на ускорителях и закупать новые серверные кластеры невозможно, так как стоимость инференса взлетает до небес. Но инженеры нашли возможности для дальнейшего снижения финальной цены токена нашлись в другом направлении.
Как новая ИИ-архитектура меняет токеномику
Кейс Kimi K3
Китайская Moonshot AI представила технический отчет по своей флагманской открытой модели Kimi K3. У нее 2,8 трлн параметров и сейчас это крупнейшая open-weight-модель в ИТ-индустрии. По классической логике трансформеров инференс подобной модели приводил бы к избыточным затратам VRAM из-за прогрессирующего «KV-ожирения» памяти. Однако разработчики минимизировали накладные расходы с помощью двух архитектурных решений:
-
Гибридная схема Kimi Delta Attention (KDA) + Attention Residuals. Модель отказывается от стандартного механизма полного внимания (Full Self-Attention). В ее структуре из 93 слоев только 24 используют вариацию архитектуры Multi-head Latent Attention (MLA), а остальные 69 слоев работают на базе линейного гибридного внимания KDA. KDA непрерывно обновляет компактную рекуррентную память, позволяя избежать сохранения огромных матриц контекста. Объем KV-Cache на длинных контекстах уменьшается в четыре раза, а пропускная способность Decode увеличивается в шесть раз.
-
Разреженность Stable LatentMoE. Из 2,8 триллиона общих параметров модели для расчета каждого конкретного токена роутер активирует всего 16 экспертов из 896 доступных, и на один шаг инференса тратится мощность, эквивалентная работе модели со 104 миллиардами активных параметров.
Благодаря замене полного внимания на линейные структуры и интеграции разреженных MoE алгоритмическая эффективность Kimi K3 выросла в 2,5 раза по сравнению с прошлым поколением моделей. Китайские инженеры снизили стоимость токена топовой модели, а весь рынок увидел, что тяжелые архитектуры класса 3T могут работать в рамках жесткой корпоративной юнит-экономики.

Математика выбора между локальным SLM и облачным API
Развитие малых языковых моделей подстегнуло дискуссию о выборе между локальным развертыванием и использованием внешних интерфейсов (Frontier LLM через API). Определить подходящий вариант можно по матрице аппаратных и экономических ограничений.
Эта таблица показывает, при каких случаях какой подход использовать:
|
Критерий эффективности |
Локальные SLM |
Внешние Frontier LLM (через облачный API) |
|
Характер затрат |
Фиксированный (CapEx / OpEx). Компания покупает свой сервер и платит за электричество. Накладные расходы не меняются от объемов суточной генерации. |
Переменный (Usage-Based). Компания платит за обработанный объем данных. Счета от провайдеров увеличиваются с ростом трафика и сложностью логики агентов. |
|
Скорость шины данных |
Аппаратные лимиты. Скорость генерации при работе с длинными контекстами определяется пропускной способностью локальной RAM или лимитами VRAM конкретной модели видеокарты. |
Высокая распределенная. Инфраструктура провайдера обеспечивает стабильную скорость инференса благодаря балансу нагрузки кластеров из тысяч ускорителей. |
|
Чувствительность данных |
Высокая. Данные компании должны оставаться внутри ее контура. |
Условная. Данные компании могут передаваться на сторонние серверы. |
|
Точка окупаемости |
Стабильная нагрузка. Вычисления идут непрерывно: разметка терабайтов данных или парсинг логов. |
Нерегулярные или пиковые задачи. Периодический запуск вычислений, где платить API выгоднее содержания простаивающего сервера. |
Пример расчет точки перелома затрат (Break-Even Analysis)
Рассмотрим для примера такой сценарий. Перед инженерами стоит задача автоматизировать обработку входящих документов объемом 10 миллионов токенов в сутки (7,5 млн входных и 2,5 млн выходных).
1) Облачный API. Возьмем средние тарифы коммерческих моделей верхнего уровня: 2,5 долларов за миллион входных токенов и 10 долларов за миллион выходных токенов.
Ежедневный платеж составляет:
(7,5 × 2,5) + (2,5 × 10) = 43,75 $ в день
За год непрерывной работы затраты на API составят 15,968 долларов.
2) Локальный сервер (Self-Hosting). Для запуска квантованной Llama-3-8B компания берет сервер с парой видеокарт Nvidia RTX 4090 за 7,000 долларов (CapEx). Годовой OpEx составит около 1,000 доллара.
(Возьмем для расчетов следующие данные. Сервер стоимостью 7,000 долларов базируется на двух видеокартах Nvidia RTX 4090 (4,200 $), специализированном 4U-корпусе с материнской платой (800 $), процессоре (600 $), 128–256 ГБ ECC RAM (500 $), мощных блоках питания (500 $) и SSD (400 $). Годовые операционные расходы (1,000 $) включают оплату электроэнергии (1 кВт/ч под нагрузкой) и резерв на амортизацию.)
В этом примере при стабильном потреблении 10 млн токенов локальный сервер полностью окупит первоначальные вложения на шестой месяц эксплуатации. Если же нагрузка колеблется за сутки в пределах 500 тысяч токенов, собственное железо не окупит вложений за три года и превратится в неликвидный актив из-за устаревания и износа чипов.
Провайдерам ИИ-вычислений приходится жестко экономить, так как каждый созданный ими токен стоит реальных денег. Цена генерации складывается из ограничений пропускной способности памяти чипов, CapEx-инвестиций, амортизации оборудования и эффективности архитектур.
Эта сложнейшая вычислительная фабрика остается за кадром, а потребители видят лишь фиксированные тарифные сетки. Возникает закономерный вопрос: как вообще формируются цены на основе всех этих нелинейных издержек?
В следующей части мы проанализируем бизнес-стратегии игроков и разберем три прикладных аспекта:
— Математика фиксированной подписки. Как провайдеры не банкротятся на подписках за 20 долларов.
— Логика инфраструктурного демпинга. Зачем ИИ-гиганты снижают собственную маржу.
— Экономика независимых провайдеров. Как брокеры инференса (вроде Groq, Together AI или OpenRouter) продают чужие токены с минимальной наценкой и как выигрывают гонку скоростей.
Об этом — в следующем материале: «Игры разума ИИ-гигантов. Маркетинг, ценовые войны и психология прайсинга».
Автор: Roman_Parabat

