---
title: "Сколько стоит месяц с агентом: API, подписки и кэш"
slug: llm-subscriptions-vs-api
canonical: https://shady2k.ru/posts/llm-subscriptions-vs-api/
date: 2026-09-16
kind: article
author: human
lang: ru
summary: "Посчитал месяц работы разработчика с агентом по ценам API и подписок
  на сентябрь 2026: где разница в десятки раз, почему считать надо в долларах и
  при чём тут кэш."
tags:
  - ai-agents
related:
  - https://shady2k.ru/posts/ai-agent-memory/
  - https://shady2k.ru/posts/hermes-agent-vs-claude-code/
---

В августе я показывал на митапе таблицу с месячной стоимостью работы через разные модели. Через месяц открыл её снова — половина цифр уже устарела. DeepSeek ввёл пиковые тарифы, Z.ai перевёл GLM Coding Plan на кредиты, появились новые модели. Пришлось пересчитать всё заново по ценам на 16 сентября и заодно разобраться, что выгоднее: платить за API или покупать подписки.

## Что я считал

За основу я взял месяц обычной работы с агентом: 492 миллиона новых входных токенов, 2,3 миллиарда токенов, прочитанных из кэша, 10 миллионов выходных и примерно 25 тысяч запросов. Понятно, что у всех своя модель потребления, это средний по больнице. Но на нём хорошо видна одна вещь, которую легко пропустить: 82% всего объёма — это кэш. В среднем запрос весит около 112 тысяч токенов, и почти весь он уже был отправлен раньше.

Считал я просто: объём каждого типа токенов умножал на цену за миллион. Запись в кэш, которую Anthropic и OpenAI тарифицируют отдельно, в расчёт не входит, поэтому для Claude и GPT реальная сумма будет выше. Для Opus 5 при стандартном пятиминутном TTL наценка в четверть цены входа добавила бы примерно $615. При часовом TTL запись стоит вдвое дороже обычного входа и добавила бы уже $2 460[^1].

> [!TAKEAWAY]
> Типичный месяц работы с агентом — это миллиарды токенов, и большая часть из них — повторно отправленный контекст. Поэтому сравнивать провайдеров по одной цене входа бессмысленно.

## Как кэш меняет стоимость

Раньше экономия токенов выглядела так: сократить промпт, выкинуть лишнее, кто-то даже вырезал из промпта пробелы. Сейчас одного этого недостаточно. Модель ничего не помнит между вызовами, и харнес — Claude Code, OpenCode, Cursor — на каждом ходу снова отправляет ей системный промпт, описания инструментов и историю. Зато провайдеры дают большую скидку на повторное чтение того же начала промпта. У большинства моделей Anthropic чтение кэша стоит 0,1 от цены входа, а у Fable 5.1 — 0,025[^1]; у OpenAI скидка достигает 90%[^2]. Большой, но стабильный промпт может оказаться дешевле маленького, который постоянно меняется.

Сколько харнес отправляет без нашего участия, я проверил на Claude Code. Только что запущенная сессия уже занимала около 45 тысяч токенов: системный промпт, инструменты, файлы памяти. На одно слово «привет» ушло ещё 18 тысяч. Стоимость определяет не то, что я напечатал, а то, что агент фактически передал. Сама модель диалог не хранит: состояние живёт в харнесе, а на следующем ходу он снова отправляет текущий контекст — исходную историю или её сжатую версию. Если харнес что-то не отправил, модель этого не знает. Подробнее о том, почему большое окно не решает задачу памяти, я писал отдельно[^3].

Отсюда правила, которые реально экономят деньги. Кэш работает по совпадающему началу: изменили что-то в начале — всё, что дальше, снова стоит полную цену. Поэтому посреди сессии не стоит переподключать MCP-серверы или менять правила, которые входят в начало промпта: у Anthropic изменение описаний инструментов инвалидирует кэш целиком[^1]. Лишние MCP-серверы и скиллы лучше подключать на уровне проекта, а не глобально, потому что их описания уезжают в каждый вызов. У Anthropic API стандартный TTL — пять минут, расширенный — час. Но в Claude Code на подписке Pro или Max в пределах включённого лимита собственные ходы пользователя и часть служебных запросов получают часовой TTL автоматически. При переходе на usage credits эти запросы возвращаются к пяти минутам, если явно не выставить `promptCacheTtl: 1h`[^1]. У GPT-5.6 и более новых моделей OpenAI минимальный TTL — 30 минут[^2]. Кэш всё равно не постоянная память: после долгого перерыва начало промпта снова придётся записать. А вот резать стабильную часть промпта вслепую не надо: агенту не хватит контекста, он начнёт читать файлы и вызывать инструменты, и итоговый счёт за сессию вырастет.

На своей статистике Claude Code я вижу другой, ещё более кэшированный профиль: 98% всех токенов — чтение из кэша. Именно поэтому цифры дальше так сильно расходятся.

> [!TAKEAWAY]
> Следить нужно не за числом токенов, а за долей попаданий в кэш. Всё, что меняет начало промпта посреди сессии, стоит полную цену за весь накопленный контекст.

## Стоимость через API

Вот сколько стоит тот же месяц, если платить за API по прайсу. Цены взяты с официальных страниц провайдеров на 16 сентября[^4]. Я использовал обычный тариф: средний запрос в этом примере — 112 тысяч токенов. Если отдельные запросы переходят long-context порог провайдера, соответствующая строка будет дороже, поэтому таблица даёт нижнюю оценку. Без распределения запросов по длине честно посчитать эту надбавку нельзя[^4].

| Модель | Вход / кэш / выход, $ за 1M | $ в месяц |
|---|---|---|
| GPT-6 Astra | 10 / 1 / 50 | 7 720 |
| Claude Fable 5.1 | 10 / 0,25 / 50 | 5 995 |
| Claude Opus 5 | 5 / 0,50 / 25 | 3 860 |
| GPT-5.6 Sol | 4 / 0,40 / 20 | 3 088 |
| Qwen 3.7 Max | 2,50 / 0,50 / 7,50 | 2 455 |
| Kimi K3 | 3 / 0,30 / 15 | 2 316 |
| Grok 4.5 | 2 / 0,30 / 6 | 1 734 |
| Qwen 3.8 Max | 2 / 0,25 / 6 | 1 619 |
| GPT-5.6 Terra | 2 / 0,20 / 12 | 1 564 |
| GLM-5.3 и GLM-5.2 | 1,40 / 0,26 / 4,40 | 1 331 |
| MiniMax M3 | 0,30 / 0,06 / 1,20 | 298 |
| DeepSeek V4.1 Flash, пик / вне пика | 0,30 / 0,006 / 1,20 и вдвое дешевле | 173 / 87 |
| GPT-5.6 Luna | 0,20 / 0,02 / 1,20 | 156 |

Anthropic выпустила Fable 5.1 с кэшем в четыре раза дешевле, чем у Fable 5, а цены Opus 5 не менялись[^4]. OpenAI снизила цену GPT-5.6 Sol до $4 за вход и $20 за выход — это промо, как минимум до 21 ноября — и выпустила GPT-6 Astra[^5]. В линейке 5.6 Sol самая большая модель, Terra средняя, Luna самая маленькая.

С китайскими моделями история обратная. DeepSeek в августе ввёл пиковые тарифы[^6]: по будням с 04:00 до 07:00 и с 09:00 до 13:00 по Москве всё стоит вдвое дороже[^7]. То есть в первой половине нашего рабочего дня. 10 сентября вышел DeepSeek V4.1 Flash, и он дешевле прежнего V4 Flash[^8]. Kimi K3 по API обходится почти как Sol[^9]. GLM-5.3 по API стоит столько же, сколько GLM-5.2[^10].

Между Astra и DeepSeek V4.1 Flash вне пика разница почти в девяносто раз: $7 720 против $87. А если бы кэша не было и весь вход стоил полную цену, тот же месяц на Opus 5 обошёлся бы не в $3 860, а примерно в $14 000.

> [!TAKEAWAY]
> Sol подешевел, DeepSeek ввёл пиковые тарифы, и цена теперь зависит ещё и от времени суток. Но разрыв между самыми дорогими и самыми дешёвыми моделями всё равно в десятки раз.

## Подписки на открытые модели

В таблице, которую я показывал в августе, подписки считались по запросам. Например, у OpenCode Go для DeepSeek V4 Flash написано, сколько запросов в месяц даёт одна подписка, делим на наши 25 тысяч и получаем число подписок. Выглядело очень выгодно. Но у Go лимиты заданы в долларах[^11], а число запросов — только оценка на запросах определённого размера. Наши запросы в несколько раз тяжелее: каждый тащит за собой сотню тысяч токенов кэша. Если пересчитать через доллары, картина другая.

| Модель в OpenCode Go | Лимит в месяц | Запросов по оценке Go | Наш месяц по API | Нужно подписок, примерно |
|---|---|---|---|---|
| DeepSeek V4.1 Flash | $60 до 20 сентября, затем $15 | 130 000 / 32 500 | $87–173 | 2–3 / 6–12 |
| Qwen 3.7 Plus | $60 | 21 600 | $305 | 6 |
| GLM-5.2 | $60 | 4 300 | $1 331 | 23 |
| GPT-5.6 Luna | $15 | 10 250 | $156 | 11 |
| Kimi K3 | $15 | 490 | $2 316 | 155 |

OpenCode Go стоит $10 в месяц, скидки на первый месяц больше нет. Получается, что Go даёт в полтора–шесть раз больше, чем стоит, и это хорошая сделка. Четырёхкратный лимит для V4.1 Flash — временная акция до 20 сентября; без неё одной подписки на наш месяц хватает только на небольшую часть объёма. Купить несколько подписок в одном workspace не получится: Go разрешает подписаться только одному его участнику[^12].

С GLM Coding Plan от Z.ai можно посчитать точнее, потому что формула кредитов опубликована[^13]. Наш месяц на GLM-5.3 — это примерно 174 тысячи кредитов в неделю в пиковые часы. Вне пика кредиты списываются вдвое медленнее, а пик у Z.ai совпадает с утренним окном DeepSeek: 09:00–13:00 по Москве в будни. План Max за $168 даёт 140 тысяч кредитов в неделю[^14]: если работать вне пика, одного хватит, если только в пик — нужно два, то есть $336. Против $1 331 по API это в четыре–восемь раз дешевле. Запросы к GLM-5.2 в подписке теперь автоматически уходят на GLM-5.3[^13].

Ollama Cloud в августе я не считал, потому что цифр у них не было. С 31 августа они перешли на кредиты в долларах: Pro за $20 даёт $60 использования в месяц, Max за $100 — $300[^15]. То есть подписка даёт в три раза больше, чем стоит.

> [!TAKEAWAY]
> Лимиты подписок в запросах обманчивы: они посчитаны на лёгких запросах. Переводите свой расход в доллары по API и делите на долларовый лимит, тогда видно, сколько подписка реально покрывает.

## Claude Code и Codex

Самые щедрые лимиты сейчас у Claude Code. Anthropic их в токенах не публикует, поэтому могу опираться только на встроенную статистику. У меня подписка Max 20x за $200; показанный Claude Code эквивалент по API-прайсу за последние два месяца был более чем в сто раз выше цены подписки. Это личный профиль потребления, а не обещание тарифа. До 13 сентября действовала акция: недельный лимит в Claude Code был на 50% выше. С 14 сентября он остаётся на 25% выше, чем был до акции[^16].

О своём переходе с Claude Code на Hermes Agent я писал отдельно[^17].

Следующий по щедрости — Codex. OpenAI публикует лимиты в сообщениях за пять часов, про токены там ничего нет, и сама пишет, что это оценки, а не фиксированные лимиты[^18]. Поэтому точно посчитать нельзя, только прикинуть. По моей оценке, на GPT-5.6 Sol нашему месяцу нужно четыре подписки Pro 5x за $100 или одна Pro 20x за $200. Но новые подписки и апгрейды на Pro 20x OpenAI с 10 сентября временно приостановила[^19]. Для Luna хватает Plus за $20.

С Cursor ситуация другая. Сторонние модели там списываются по цене API[^20], а сколько использования включено в тариф, на официальных страницах больше не пишут. Для наших объёмов Cursor стоит примерно как API, и на Teams-тарифах сверху добавляется $0,25 за каждый миллион токенов[^20].

Почему это не навсегда, понятно из тех же цифр. Спонсировать каждому пользователю тысячи долларов в месяц компании бесконечно не смогут. Прайсы, акции и лимиты уже несколько раз менялись, подписки пока держатся. На митапе я говорил, что постепенно лимиты будут снижаться, а цены — расти.

> [!TAKEAWAY]
> Подписки Anthropic и OpenAI сейчас дают в десятки раз больше, чем стоят, но их лимиты не опубликованы и могут поменяться в любой момент. Планировать бюджет на них можно, рассчитывать на них как на постоянную цену — нет.

## Бенчмарки и цена

Я попытался привести цену к качеству: взял LiveBench, SWE-Bench Pro и Terminal-Bench 2.1, сравнил каждую модель с GPT-5.6 Sol и пересчитал стоимость через получившийся коэффициент. Честного коэффициента из этих строк не получилось[^21].

Среднее геометрическое не делает исходные данные сопоставимыми. В одном Terminal-Bench модели запускались разными харнесами, для части моделей нет результата по одному из тестов, а названия в таблицах относятся к разным версиям и режимам усилия. Одно число после запятой создаёт точность, которой в источниках нет.

Поэтому я не стал публиковать «цену с поправкой на качество». Бенчмарки помогают понять класс модели и выбрать кандидатов для своей проверки, но не переводят качество в доллары. Для бюджета надёжнее разделить задачи: дешёвой модели отдать рутину, дорогой — то, где ошибка или ещё один круг работы стоят больше разницы в токенах.

> [!TAKEAWAY]
> Бенчмарки нельзя механически превратить в множитель цены: разные версии, харнесы и пропущенные результаты делают такой коэффициент точнее на вид, чем по сути.

## Как я теперь выбираю модель

Для повседневной работы — писать код по готовой спецификации, чинить баги, отлаживать — не нужна самая умная модель. С этим отлично справляются GPT-5.6 Luna и DeepSeek Flash, а стоят они в десятки раз дешевле флагманов. Документацию, архитектуру и сложную аналитику лучше отдать Opus или Sol. У меня работает и связка: сначала дешёвая модель пишет документ, потом Opus его исправляет. В таких задачах дорогая модель получает уже собранный контекст вместо того, чтобы начинать с нуля.

Если платить из своего кармана, то сейчас выгоднее всего подписки Claude и Codex под сложные задачи и дешёвые модели по API или через OpenCode Go под рутину. GLM Coding Plan и Ollama Cloud тоже хороши, особенно если основная работа приходится не на утро. Кому это не подойдёт: тем, кому нужна предсказуемость. Лимиты подписок не опубликованы и меняются, у китайских провайдеров цена зависит от часа, а промо-цены вроде Sol закончатся в ноябре.

Цифры в этой статье актуальны на 16 сентября. Судя по тому, как быстро устарела моя августовская таблица, через месяц их снова придётся пересчитывать.

> [!TAKEAWAY]
> Модель выбирается под задачу: дешёвая на рутину, дорогая на то, где действительно нужен ум. В моих повседневных задачах разница в цене заметнее, чем в результате.

## Выводы

1. Типичный месяц работы с агентом — это миллиарды токенов, и большая часть из них — повторно отправленный контекст. Поэтому сравнивать провайдеров по одной цене входа бессмысленно.
2. Следить нужно не за числом токенов, а за долей попаданий в кэш. Всё, что меняет начало промпта посреди сессии, стоит полную цену за весь накопленный контекст.
3. Sol подешевел, DeepSeek ввёл пиковые тарифы, но разрыв между самыми дорогими и самыми дешёвыми моделями всё равно в десятки раз.
4. Лимиты подписок в запросах обманчивы: они посчитаны на лёгких запросах. Переводите свой расход в доллары по API и делите на долларовый лимит.
5. Подписки Anthropic и OpenAI сейчас дают в десятки раз больше, чем стоят, но их лимиты не опубликованы и могут поменяться в любой момент.
6. Не превращайте разрозненные бенчмарки в один «коэффициент качества»: точность такого числа будет мнимой.
7. Модель выбирается под задачу: дешёвая на рутину, дорогая на то, где действительно нужен ум.

[^1]: [Anthropic: Prompt caching](https://platform.claude.com/docs/en/build-with-claude/prompt-caching): «5-minute cache write tokens are 1.25 times the base input tokens price»; «1-hour cache write tokens are 2 times the base input tokens price»; «Cache read tokens are 0.1 times the base input tokens price». Для Fable 5.1 и Mythos 5.1 там же указано исключение 0,025 от базовой цены. В API по умолчанию «automatic caching uses a 5-minute TTL», часовой TTL задаётся явно. Для Claude Code на подписке действует отдельное правило из [официальной документации по расходам](https://console.anthropic.com/docs/en/agent-sdk/cost-tracking): «On a Claude subscription within your plan’s included usage, you get the 1-hour TTL on your own turns, and on some of the helper requests Claude Code makes beside them»; при использовании usage credits Claude Code «drops those turns to the 5-minute TTL». Изменения кэша идут по иерархии «tools → system → messages» и инвалидируют изменённый уровень и все последующие.
[^2]: [OpenAI: Prompt caching](https://developers.openai.com/api/docs/guides/prompt-caching): «subsequent reads cost only 0.1x that rate»; для GPT-5.6 и новее «The only supported value, `30m`, is also the default».
[^3]: [Память AI-агентов: что помнить, где хранить и как забывать](/posts/ai-agent-memory/)
[^4]: Официальные прайсы на 16 сентября: [Anthropic](https://www.anthropic.com/pricing) — «Fable 5.1 … Input $10 / MTok … Read $0.25 / MTok … Output $50 / MTok» и «Opus 5 … Input $5 / MTok … Read $0.50 / MTok … Output $25 / MTok»; [OpenAI](https://developers.openai.com/api/docs/pricing) — строки `gpt-6-astra $10.00 $1.00 $12.50 $50.00`, `gpt-5.6-sol $4.00 $0.40 $5.00 $20.00`, `gpt-5.6-terra $2.00 $0.20 $2.50 $12.00`, `gpt-5.6-luna $0.20 $0.02 $0.25 $1.20`; [Alibaba Cloud](https://www.alibabacloud.com/help/en/model-studio/model-pricing) — `qwen3.7-max … $0.5 … $2.5 … $7.5`, а [для Qwen3.8-Max](https://www.alibabacloud.com/help/en/model-studio/qwen3-8-max) — «Input | 2», «Output | 6», «Input(Implicit Cache) | 0.25»; [Kimi K3](https://platform.kimi.ai/docs/pricing/chat-k3) — `$0.30 / $3.00 / $15.00` для cache hit, cache miss и output; [xAI](https://docs.x.ai/developers/pricing) — `grok-4.5 … $2.00 $0.30 $6.00`; [Z.ai](https://docs.z.ai/guides/overview/pricing) — `GLM-5.3 | $1.4 | $0.26 | … | $4.4` и та же строка для GLM-5.2; [DeepSeek](https://api-docs.deepseek.com/quick_start/pricing) — для V4.1 Flash вне пика `$0.003 / $0.15 / $0.6`, в пик `$0.006 / $0.3 / $1.2`; [MiniMax](https://platform.minimax.io/docs/guides/pricing-paygo) — `MiniMax-M3 <= 512k input tokens … $0.30 … $1.20 … $0.06`. В тех же таблицах OpenAI, Anthropic и xAI есть отдельные long-context ставки, поэтому основной расчёт — нижняя оценка.
[^5]: [OpenAI API Pricing](https://developers.openai.com/api/docs/pricing), [GPT-5.6 changelog](https://developers.openai.com/api/docs/changelog): «GPT-5.6 Sol now costs $4 per million input tokens and $20 per million output tokens»; «promotional pricing is available at least through November 21, 2026».
[^6]: [DeepSeek V4 Pro GA Release](https://api-docs.deepseek.com/news/news260813): «we will adopt peak/off-peak pricing, with off-peak prices set at half of the peak-hour prices».
[^7]: [DeepSeek: Models & Pricing](https://api-docs.deepseek.com/quick_start/pricing): «Peak hours are 01:00 - 04:00 and 06:00 - 10:00 UTC, Monday through Friday (all other hours are off-peak)»; «Off-peak rates are half of the peak rates».
[^8]: [DeepSeek V4.1 Flash](https://www.deepseek.com/en/news/deepseek-v4-1-flash): «News September 10, 2026» и «V4.1-Flash is now live on the DeepSeek API»; актуальные ставки приведены в [прайсе](https://api-docs.deepseek.com/quick_start/pricing).
[^9]: [Kimi API pricing](https://platform.kimi.ai/docs/pricing/chat-k3): строка `kimi-k3` указывает `$0.30` за cache-hit input, `$3.00` за cache-miss input и `$15.00` за output.
[^10]: [Z.ai API Pricing](https://docs.z.ai/guides/overview/pricing): для GLM-5.3 и GLM-5.2 опубликована одна строка — `$1.4 | $0.26 | Limited-time Free | $4.4`.
[^11]: [OpenCode Go](https://opencode.ai/docs/go): «Usage limits are defined as monthly dollar amounts»; таблица estimated requests названа «an estimated request count based on typical Go usage patterns». В ней же приведены `DeepSeek V4.1 Flash | $0.30 | $1.20 | $0.006 | $0.375 | $60`, `Qwen 3.7 Plus | $0.40 | $1.60 | $0.04 | $0.50 | $60` и опубликованные оценки запросов.
[^12]: [OpenCode Go](https://opencode.ai/docs/go): «low cost $10/month subscription» и «Only one member per workspace can subscribe to OpenCode Go». В таблице DeepSeek V4.1 Flash помечен `4x · Ends Sep 20`.
[^13]: [Z.ai: GLM Coding Plan](https://docs.z.ai/devpack/overview): «Model credit usage = (Input tokens × Input multiplier + Cached Input tokens × Cached Input multiplier + Output tokens × Output multiplier) / 10,000»; вне пика «model usage is charged at 50% of the standard credit rate». Там же: «Requests for GLM-5.2/GLM-5.1 will be automatically routed to GLM-5.3».
[^14]: [Z.ai: планы GLM Coding Plan](https://z.ai/subscribe?plantype=individual) — Max стоит $168 при помесячной оплате; [документация](https://docs.z.ai/devpack/overview) указывает `Max | 28,000 | 140,000` для пятичасового и недельного лимитов.
[^15]: [Ollama's transparent pricing](https://ollama.com/blog/transparent-pricing), [Ollama Cloud pricing](https://ollama.com/pricing): «Pro: $20/month, includes $60 of monthly usage»; «Max: $100/month, includes $300 of monthly usage».
[^16]: [Anthropic: Claude Code weekly limits promotion](https://support.claude.com/en/articles/15910845-claude-code-may-august-2026-weekly-limits-promotion): «It ran from May 13 through September 13, 2026»; «starting September 14, 2026, weekly limits in Claude Code are 25% higher than they were before the promotion».
[^17]: [Hermes Agent вместо Claude Code](/posts/hermes-agent-vs-claude-code/)
[^18]: [OpenAI: Codex pricing and usage limits](https://developers.openai.com/codex/pricing): «The estimates below show local messages per five-hour period» и «These estimates are not fixed message limits».
[^19]: [OpenAI: About ChatGPT Pro tiers](https://help.openai.com/en/articles/9793128-about-chatgpt-pro-tiers): «Pro $100 unlocks 5x higher usage than Plus, while Pro $200 unlocks 20x usage than Plus»; «As of September 10, 2026, we're temporarily pausing new sign-ups and upgrades to the ChatGPT Pro $200 plan».
[^20]: [Cursor: Models & Pricing](https://cursor.com/docs/models-and-pricing), [Team Pricing](https://cursor.com/docs/account/teams/pricing): «third-party model requests include a Cursor Token Rate of $0.25 per million tokens»; ставка применяется «on top of model API pricing».
[^21]: [LiveBench](https://livebench.ai/), [SWE-Bench Pro](https://benchlm.ai/benchmarks/swe-bench-pro), [Terminal-Bench 2.1](https://www.tbench.ai/leaderboard/terminal-bench/2.1). Даже агрегатор SWE-Bench Pro предупреждает: «The table preserves exact published rows from different providers, so a small score gap is directional unless the setups match».
