⌂ все дашборды/Качество и аудиты← Token-Audit-2026-07-05 · Token-Spend-Audit →

Куда уходят токены — и сколько можно снять с Claude

Замер по транскриптам, 0 токенов LLM · узел A-2022BAYAREA (хаб) · окно 7 дней · собран 2026-08-06 · движок token_audit.py
36 784 409
выход модели за 7 дней
1 080
сессий с расходом
~82 %
выхода — механика, а не суждение
4.0 %
выбрано бака Codex
$540
подписок в месяц

1. Куда именно уходит выход модели

класс работытокеновдоляуезжает на чужую рельсу?
прогон команд (shell)20 025 18354.4 %
да, почти целиком
правка кода5 734 79615.6 %
да
чтение и поиск по файлам4 558 65512.4 %
да
наши MCP-коннекторы3 947 02410.7 %
⛔ нет, привязаны к машине
прочее1 235 6493.4 %
частично
оркестрация660 2251.8 %
⛔ нет, это и есть моя работа
чистый диалог и письмо573 3831.6 %
⛔ нет, голос Антона
веб49 4940.1 %
да
Класс определяется по инструментам, которые сессия реально звала, и раскладывается пропорционально. Это оценка распределения, а не точный счёт по каждому вызову: транскрипт не хранит «токены на инструмент». Порядок величин — доказанный, второй знак после запятой — нет.

2. Утилизация оплаченного

вендортариф$/месвыбрано бакавердикт
ClaudeAnthropic Max200не измерено 🤔 прибора нет — вендор не отдаёт %; при этом 4 упора в лимит за неделю
GrokSuperGrok300не измерено 🔴 ни разу не мерили — самая дорогая подписка
ChatGPTPro (Codex)20+4.0 % (цифра OpenAI) 🔴 недобор
GeminiGoogle Pro20не измерено 🔴 ни разу не мерили
Тариф ChatGPT в реестре стоит по нижней границе: с 09.04.2026 у OpenAI два тарифа Pro ($100 и $200), токен говорит «pro», но не говорит какой. Цифра $540/мес — сумма реестра, не проверенный счёт.

3. Сколько можно снять — и чем это ограничено

Потолок переноса: 82.5 % выхода (shell + код + чтение + веб = 30.4 млн токенов за неделю). Это верхняя граница, а не план.

Реалистичный первый шаг: чтение и правка кода = 28 % (10.3 млн). Именно этот класс чужие CLI берут без переделки нашей архитектуры: у них есть свой Read/Edit/Grep, им нужна только папка и задача.

Что мешает снять shell (54 %), хотя формально он «механика»: добрая половина наших команд трогает волт, secrets\, шину и живые сессии браузера. Отдать это чужой рельсе — значит отдать наружу приватные данные. Снимается тот shell, который живёт внутри репозитория задачи, а не тот, что ходит по машине.

🤔 Гипотеза, не доказанный факт: доля «репозиторного» shell внутри 54 % не измерена. Чтобы её узнать, нужен отдельный разрез по путям, которые команды трогают.

4. Второй рычаг, который дешевле первого

модельвызовов за 7 днейчто это значит
claude-opus-522 205Opus работает чернорабочим: 63 % всех вызовов
claude-sonnet-57 513грунт — должен быть на первом месте, а не на втором
claude-opus-4-84 709старый Opus в рутинах
claude-fable-53 757мышление и голос — здесь всё правильно
Перенос части этих 22 205 вызовов с Opus на Sonnet не требует ни одной чужой рельсы и не создаёт риска приватности. Это самый дешёвый ход из всех, что есть в таблице.

5. Что уже работает, а что оказалось пустым

рельсавызовов 7дстатус
Codex (ревью и аутсорс кода)33живая
Gemini (третья пара глаз)25живая
Grok (вторая рельса)17живая, но $300/мес против 17 вызовов
Deep Research (веер по 6 вендорам)50самый нагруженный канал
OpenCode как исполнитель кода1❌ провалил боевую задачу: 10 минут, 1 файл из 4, и не тот

6. Итоговая раскладка: кто что делает

рельса$/месзабираетстатус
Claude Max200 оркестрация · наши MCP-коннекторы · разговор с Антоном и его голос · суждение не двигается никуда: привязано к машине и к роли
Codex ChatGPT Pro200 прогон команд внутри задачи · писание и правка кода · чтение и разбор файлов · оркестрация Deep Research бак 4 % — главный недобор
Grok SuperGrok300 разбор входящего и ответы тира B · выжимки · классификация и разметка подключено сегодня, первый замер завтра после 08:30. Модель одна, grok-4.5. ⚠️ рельса без инструментов, ресёрч ей давать нельзя
Gemini Google Pro20 веб-поиск и чтение страниц · вторая рельса разбора 🔴 сломана: ходит на flash и упирается в БЕСПЛАТНУЮ квоту, оплаченная Pro не тратится вообще
Машинная истина маршрутов — ~/.claude/llm_routing.json, читается llm_ask.py --routing, зовётся llm_ask.py --class <класс>. Маршруты в скрипты не копируются: один источник, ноль копий.

7. Порядок работ и честные блокеры

1. Снять Opus с грунтовых рутин. Самый дешёвый ход: чужие рельсы не нужны, риска приватности нет. Блокер: не доказано, слушается ли поле model во frontmatter рутины.

2. Код и чтение → Codex (28 % выхода, 10.3 млн токенов в неделю). Рельса построена. Блокер: за 7 дней через неё прошли 2 задачи, обе не дотестированы — рельса не доказана, а не «гудит».

3. Разбор входящего → Grok. ✅ подключено: ежедневный триаж в 08:30 отдаёт Grok ответы тира B, раньше это делал Sonnet.

4. Починить рельсу Gemini — увести с бесплатной квоты на оплаченную Pro, и только потом давать ей работу.

5. Оркестрация Deep Research → Codex. Единственный класс с объёмом (50 ДР в неделю), достаточным, чтобы сдвинуть бак с 4 %. Блокер: веер ДР идёт через браузер, а CLI-рельсы работают без инструментов и ресёрч не тянут.

8. Границы, которые не двигаются

Волт, шина и код отдаются чужим вендорам свободно (решение Антона 06.08: доверяем крупным вендорам так же, как Claude).

Значения из secrets\ не уходят никому, включая Claude: передаём путь и имя ключа. Это инженерное суждение, а не слова Антона — вопрос числа копий, а не доверия к вендору; утёкший ключ переиспользуем любым, кто когда-либо видел лог, включая наши собственные. Снимается одной его строкой.

У чужих вендоров — всегда самая умная модель, чтобы выжигать их лимиты. Тихий спуск на дешёвый класс = ошибка рельсы, а не «деградация». Внутри Claude правило обратное: результат читает робот → Sonnet.

Гейт качества главнее экономии. Тянет хуже планки — эскалируем и говорим вслух.

Цифры сняты с диска и воспроизводятся: token_audit.py 7 · subscription_utilization.py report · subscription_utilization.py measure. Личные данные, CRM и содержимое сессий на этой странице не публикуются — только агрегаты.