LLMsRelay/Документация
Назад в кабинет

Как экономить токены на Claude API — простые советы

Длинные сессии, prompt caching, правильный выбор модели и короткие промпты. Понятные советы, которые реально снижают расход токенов на Claude API.

Почему токены уходят так быстро

За каждое сообщение Claude API списывает деньги по двум статьям: входные токены (то, что вы отправили) и выходные токены (то, что модель написала в ответ). Чем больше текста туда-сюда — тем выше счёт. Хитрость не в том, чтобы пользоваться Claude меньше, а в том, чтобы не отправлять один и тот же контекст снова и снова.

Совет 1. Работайте в одной длинной сессии

Это самый сильный приём. Когда вы кодите в Claude Code, Cursor, Cline или любом другом IDE-агенте — старайтесь вести задачу в одной длинной беседе, а не открывать новый чат под каждое маленькое действие.

Внутри одной сессии Claude API включает prompt caching: системный промпт, файлы проекта, правила и предыдущие сообщения тарифицируются примерно в 10% от обычной цены на каждом следующем шаге. Открыли новый чат — кэш сбросился, и весь контекст снова идёт по полной цене.

Простое правило: одна задача — одна сессия. Не перезапускайте чат после каждой правки. Чем дольше вы остаётесь в одной беседе, тем дешевле каждое следующее сообщение.

Совет 2. Правильно выбирайте модель

Не включайте Opus на всё подряд. Это самая мощная модель Claude, но и самая дорогая. Для повседневного кода, рефакторов и обычных вопросов Sonnet закрывает 90% задач за заметно меньшие деньги.

Haiku — для простого: автодополнение, классификация, короткие ответы. В разы дешевле Sonnet и при этом достаточно быстрая.

Совет 3. Короткие и точные промпты

Выходные токены примерно в 5 раз дороже входных, но и вход накапливается — особенно если вы из «на всякий случай» вставляете целые файлы. Две дешёвые привычки:

  • Вставляйте только нужный кусок файла, а не весь файл целиком.
  • Задавайте один чёткий вопрос вместо стены контекста с надеждой «модель сама разберётся».

Совет 4. Ограничивайте длину ответа

В большинстве клиентов есть параметр max_tokens. Если вам нужна функция, абзац или короткий ответ — поставьте лимит. Модель остановится раньше, и вы заплатите только за реально нужное.

Совет 5. Не плодите сессии под каждую правку

Это самая частая ошибка в IDE-агентах. Открыл Cursor, спросил одно — получил правку, открыл новый чат под следующую мелочь. И так 30 раз за день. Баланс уходит на глазах.

Каждый новый чат = новый системный промпт + новый контекст проекта + повторно загруженные файлы по полной входной цене. Те же 30 вопросов внутри одной сессии стоили бы в разы дешевле — потому что после первого сообщения работает кэш.

Совет 6. Следите за расходом

Первую неделю заглядывайте в дашборд раз в день. Сразу видны самые дорогие паттерны: разогнавшийся агент в цикле, раздутый системный промпт или забытый запрос «опиши весь репозиторий». Починили один такой — экономия больше, чем от всех остальных советов вместе взятых.

Коротко

  • Одна задача = одна длинная сессия. Дайте кэшу делать своё дело.
  • По умолчанию Sonnet, Opus — только когда реально нужно, Haiku — для простого.
  • Сокращайте промпты, ставьте max_tokens, не вставляйте файлы целиком.
  • Перестаньте открывать новый чат под каждый шаг в IDE-агенте.
  • Регулярно смотрите usage и убирайте главного «прожору».

Готовы начать?

Получите доступ к API всех моделей Claude за 2 минуты.

Смотреть тарифы