Да, при работе с Claude Code (особенно если вы перенаправляете запросы на сторонние модели вроде DeepSeek через прокси-серверы или API-шлюзы) расход токенов может быть очень высоким из-за агентной природы инструмента.
Для оптимизации затрат и экономии токенов можно использовать как встроенные механизмы Claude Code, так и специализированные сторонние утилиты.
1. Встроенные команды управления контекстом
Самый быстрый способ сэкономить токены во время работы — не давать контексту разрастаться в рамках одной сессии:
- Команда /compact: Обязательно используйте её, если диалог затянулся. Она просит модель сделать краткую выжимку (summary) текущего прогресса и очищает длинную историю сообщений, оставляя только суть. Это позволяет снизить размер входного контекста на последующих шагах.
- Команда /clear: Если вы закончили одну задачу и переходите к другой, не продолжайте диалог в той же сессии. Очистите историю, чтобы модель не тащила за собой старые файлы и логи.
2. Настройка отложенной загрузки инструментов (ENABLE_TOOL_SEARCH)
По умолчанию Claude Code отправляет полные JSON-описания (схемы) всех своих инструментов (Bash, Read, Write, Edit, Grep и др.) при каждом запросе. Это может добавлять от 3 000 до 5 000 «лишних» токенов на каждый шаг.
Вы можете включить так называемую прогрессивную загрузку инструментов (Deferred Loading). Для этого добавьте переменную окружения в ваш файл конфигурации .claude/settings.local.json (или в глобальный .claude/settings.json):
{
"env": {
"ENABLE_TOOL_SEARCH": "auto"
}
}
Когда эта опция активна, Claude Code не загружает схемы всех инструментов сразу, а ищет и подключает их динамически по мере необходимости, что может снизить стартовый объем токенов на величину до 85%.
3. Специализированные Open Source утилиты
Разработчики создали несколько полезных инструментов специально для оптимизации расходов в Claude Code:
- RTK (Rust Token Killer): Эта утилита встраивается как хук (PostToolUse hook) в Claude Code. Она перехватывает вывод тяжелых команд терминала (например, если вы запустили тесты или сборку проекта, которая вывела 10 000 токенов логов) и автоматически сжимает этот вывод, вырезая дубли, пустые строки и оставляя только строки с ошибками. Это экономит от 60% до 90% токенов на чтении вывода команд.
- Caveman Claude: Дополнение или набор инструкций, заставляющий модель отвечать в крайне лаконичном, «телеграфном» стиле. Поскольку стандартные ответы моделей часто содержат много вежливых и избыточных фраз (что также расходует выходные токены), такой подход позволяет экономить до 75% токенов на генерации ответов.
4. Оптимизация CLAUDE.md и игнорирование файлов
Claude Code автоматически считывает инструкции из файла CLAUDE.md при каждом обращении.
- Гигиена CLAUDE.md: Старайтесь держать этот файл лаконичным (желательно до 1 000–2 000 токенов). Пишите правила емко, как техническую спецификацию. Избыточный текст в этом файле будет напрямую увеличивать стоимость каждого вашего запроса.
- Использование .claudeignore: Обязательно настройте правила игнорирования для файлов проекта. Убедитесь, что Claude Code не пытается читать тяжелые файлы логов, папки сборки (dist, build), кэши, медиа-файлы или node_modules.
5. Контроль кэширования контекста (Prompt Caching)
Для первого провайдера (Anthropic) Claude Code по умолчанию активно использует функцию Prompt Caching (кэширование контекста). Именно благодаря кэшированию повторная отправка 24 000 токенов стоит на 90% дешевле.
Если вы перенаправляете запросы на альтернативную модель (например, DeepSeek):
- Убедитесь, что ваш API-провайдер/прокси (например, OpenRouter или собственный шлюз) корректно поддерживает и пробрасывает заголовки кэширования контекста.
- DeepSeek на уровне своего API отлично поддерживает Context Caching. Если ваш прокси настроен правильно, стоимость повторных запросов в рамках сессии должна падать в разы благодаря кэшированию системного промпта и файлов проекта. Чтобы проверить, работает ли это, вы можете использовать команду /cost или /usage непосредственно в интерфейсе Claude Code.

