Claude Code · 6 мин

Как экономить токены: из чего складывается счёт

Разбор цены запроса по частям — вход, выход, кэш и повторное чтение контекста. Девять приёмов, которые снижают расход в разы, и способ увидеть, куда именно уходят токены.

Токен — не слово и не символ. Это кусочек текста, на которые модель режет всё, что читает и пишет. В русском языке один токен — примерно половина слова, иногда меньше. Счёт складывается из двух частей: сколько модель прочитала и сколько написала.

Главная ошибка в экономии — считать сообщения. Расход определяется не числом вопросов, а объёмом контекста, который прогоняется на каждом шаге.

Откуда берётся расход

Разложу запрос на части. Цифры условные, важны пропорции.

Часть запроса Что туда входит Сколько весит
Системная инструкция правила проекта, роль, формат ответа читается каждый раз
История разговора все предыдущие сообщения целиком растёт линейно
Приложенные материалы файлы, логи, выгрузки обычно самое тяжёлое
Твой вопрос собственно задача крохи
Ответ модели текст, код, рассуждения оплачивается дороже входа

Отсюда главный вывод: твой вопрос почти ничего не весит, платишь ты за то, что лежит вокруг него. Один и тот же вопрос в чистом разговоре и в разговоре на третий час стоит по-разному в разы.

Девять приёмов, отсортированных по отдаче

1. Новый разговор под новую задачу. Самый сильный приём из всех. История тащится в каждый запрос целиком, поэтому закрытая задача в открытом разговоре — это налог, который ты платишь до конца дня.

2. Не читать большие файлы целиком. Лог на десять тысяч строк, выгрузка, длинный конфиг. Почти всегда нужен фрагмент. Просить нужный кусок — минута, читать всё — самый дорогой шаг рабочего дня.

3. Кэшировать повторяющуюся часть. Если в каждый запрос идёт один и тот же справочник или свод правил, его можно пометить как кэшируемый: повторное чтение стоит заметно дешевле обычного. На конвейерах, где инструкция одна, а данные меняются, это главная статья экономии.

4. Короткие правила проекта. Файл правил читается на каждом запуске. Страница — нормально. Десять страниц — плата за каждую мелочь, включая «поправь опечатку».

5. Грязную разведку — в отдельную голову. Поиск по репозиторию, обход папок, просмотр логов дают гору вывода. Если это делает подагент, гора остаётся у него, а тебе возвращается вывод в несколько строк.

6. Младшая модель на простых задачах. Разметка, классификация, переименование, короткие ответы не требуют старшей модели. Разница в цене между линейками — не проценты, а кратность.

7. Просить короткий ответ. Вывод стоит дороже ввода. «Ответь списком из пяти пунктов» экономит больше, чем кажется, и заодно делает ответ полезнее.

8. Пакетная обработка. Сто однотипных задач одним заходом дешевле, чем сто заходов, — и по токенам, и по времени. Если ответ терпит ожидание, пакетный режим API дешевле обычного.

9. Инструкция вместо повторных объяснений. Третий раз объясняешь модели одно и то же — заводи скилл или файл с правилами. Повтор вводных руками оплачивается каждый раз заново.

Что даёт экономию, а что только кажется

Кажется экономией На деле
писать короткие вопросы вопрос весит копейки
убирать вежливые слова ноль эффекта
открыть новый чат после исчерпания лимита квота общая, не помогает
просить «отвечай кратко» работает: вывод дороже ввода
сжать разговор, когда он разросся работает: выкидывает промежуточное
разложить работу на разговоры по задачам работает сильнее всего

Первые три пункта — самые популярные советы в интернете, и они бесполезны.

Как найти свою утечку за пять минут

Разбор делается по памяти, без инструментов.

  1. Сколько разговоров ты открыл за день? Один длинный — вот и ответ.
  2. Читал ли что-то большое целиком? Логи и данные — главные пожиратели.
  3. Какого объёма файл правил проекта? Больше экрана — режь.
  4. Сколько раз объяснял одно и то же? Каждый повтор оплачен.
  5. Сколько сделанного было разведкой, а не работой? Разведка должна уходить вниз.

Обычно основную утечку даёт один пункт из пяти. У меня это была привычка открывать файл целиком вместо нужного фрагмента.

Где смотреть реальные цифры

Если работаешь по ключу API — в консоли есть расход по дням и моделям, это точные деньги. Если по подписке — точного счётчика токенов нет, ориентир косвенный: как быстро ты упираешься в лимит при одинаковом объёме работы.

Полезная привычка: раз в неделю сравнивать «сколько сделал» и «во сколько упёрся». Рост второго при том же первом означает, что где-то завёлся мусор в контексте.

Про тариф

Порядок действий такой: сначала гигиена контекста, потом тариф. Если купить больше лимита и продолжать жечь его так же неаккуратно, ты просто отодвинешь стену на пару часов.

Три сценария и что экономит в каждом

Универсальных советов здесь нет: расход по-разному устроен у разговора, конвейера и разовой обработки данных.

Диалог с правками файлов. Основной вес — история и прочитанные файлы. Работает: короткие сессии, точные пути, чтение фрагментов. Не работает: попытки писать лаконичные вопросы.

Конвейер по расписанию. Инструкция одинакова, меняются только данные. Работает: кэширование постоянной части, младшая модель, жёсткий потолок вывода. Именно здесь экономия считается не процентами, а разами.

Разовая обработка большого списка. Работает: пакетный режим, предварительный прогон на десяти строках, ограничение формата ответа одной строкой на элемент.

Ошибка — переносить приёмы из одного сценария в другой. Кэш бесполезен в живом разговоре, где контекст меняется каждый шаг, а короткие сессии не помогают конвейеру, у которого сессии и так нет.

Что стоит дороже: думать или писать

Полезно помнить, что рассуждения модели — это тоже выход, и он оплачивается. Просьба «распиши ход мыслей подробно» на каждой мелочи удваивает счёт на ровном месте.

Разумный баланс: развёрнутое рассуждение — там, где решение неочевидно и цена ошибки высокая. Короткий ответ — везде, где задача механическая. На конвейере, который делает одно и то же тысячу раз, экономия от одного этого правила больше, чем от смены тарифа.

Гигиена контекста как привычка

Экономия токенов — не разовая настройка, а три привычки, которые въедаются за неделю.

  1. Закрыл задачу — закрыл разговор. Самое сильное правило из всех.
  2. Спрашивай про кусок, а не про файл. «Покажи функцию X» вместо «прочитай весь модуль».
  3. Третий повтор — в инструкцию. Если объясняешь одно и то же трижды, это не разговор, а недописанный скилл.

Эти три строки экономят больше, чем любые тонкие настройки, — и работают одинаково на подписке и на ключе.

Частые вопросы

Что такое токен и сколько это символов?

Токен — фрагмент текста, на которые модель режет ввод и вывод. В русском языке один токен обычно составляет примерно половину слова, в английском — почти слово целиком.

Что тратит больше токенов: вопрос или контекст?

Контекст. Сам вопрос весит копейки, а вместе с ним прогоняются правила проекта, вся история разговора и приложенные файлы.

Помогает ли просить короткие ответы?

Да. Вывод оплачивается дороже ввода, поэтому ограничение формата ответа даёт заметную экономию и обычно улучшает качество.

Что такое кэширование промпта и когда оно окупается?

Это пометка повторяющейся части запроса, после которой её повторное чтение стоит дешевле. Окупается, когда инструкция или справочник одинаковы во многих запросах подряд.

Стоит ли переходить на дешёвую модель ради экономии?

На простых задачах — да, разница в цене кратная, а качество не страдает. На сложной работе с кодом и длинными рассуждениями экономия оборачивается переделками.

Это только фундамент. А дальше?

Как собрать первый скилл под себя, построить контент-завод, привести трафик и превратить подписчика в оплату — разбираю по шагам в Telegram. Честный дневник стройки с нуля.

📲 Зайти в канал и идти рядом 🔥