Как мы используем сторонние LLM (06.08.2026)
Как мы используем сторонние LLM прямо сейчас
Базовый замер 06.08.2026 12:40 (машина HP17); обновление 09.08.2026 12:45, машина A-2022BAYAREA (хаб) — секция «Архитектура рельс» и цифры второго мнения пересчитаны по хабовому леджеру. ⚠️ usage.jsonl и outsource_ledger.jsonl — ПЕР-МАШИННЫЕ: лейны 2-3 ниже описывают тот узел, где сняты (помечено). Источники: _dr/queue (веер ДР, весь флот), cc-review/bridge-state/usage.jsonl, outsource_ledger.jsonl. Всё посчитано скриптом по файлам на диске, ничего по памяти.
Архитектура рельс второго мнения (приказы 06-07.08) — кто за что платит
| Ярус | Рельса | Роль | Доказательство, что живо |
| 1. Дефолт тестов и ломателей | OpenRouter (4 семьи: GLM-flash, Gemini-flash-lite, DeepSeek-flash, Qwen-coder; ~0.15 цента за панель) | панель /tt и QA-разборы: 4 дешёвых мнения из РАЗНЫХ семей вместо 2-3 подписочных (замер 07.08: 4/4 ответили против 2/4 у CLI) | 09.08 12:38, хаб: первый CLI-прогон panel --rails auto — 4/4 моделей, CLI-бэкап не понадобился |
| 2. Бэкап панели | CLI codex / grok / gemini (подписки) | автоматически зовутся, когда OpenRouter дал <2 мнений; мнения СУММИРУЮТСЯ (1 orouter + 1 CLI = кворум) | регресс-сетка 21/21, кейсы 9a-9c; мутация краснит |
| 3. Серьёзная работа | Подписочные баки (Codex-писатель, DR-веер, стратегические панели --rails cli --role strategy --mode max) | мышление и код, где качество важнее цены; OpenRouter сюда НЕ пускаем (платные токены) | стратегическая панель мемо 07.08: codex+grok+gemini, кворум с GLM 4/6 |
| 4. Ручной резерв | Браузерные двери (chat.z.ai GLM, веб-вееры) | когда headless-двери нет или мертва; вердикт возвращается руками через log-ext | замыкание ~8% (24 промпта / 2 вердикта до 07.08) — известная дыра разомкнутой ноги |
Новое с 07-09.08: у панели появились --rails auto|orouter|cli|both, --role break|verify|counter|propose|strategy и --mode fast|max (режим доезжает до reasoning-effort вендора: max→high, fast→medium). Хабовый леджер за 7 дней: панельных вызовов 236 (codex 109 · grok 85 · gemini 70) + 19 через OpenRouter + 3 GLM-веб; роли: break 126 · strategy 14; режим max 132 · fast 8.
3
лейна, где живут сторонние LLM
92
боевых вызовов второго мнения (21.07-05.08)
46 ч
простоя аутсорса кода (последняя задача 04.08 15:23)
Главное одной строкой. Сторонние LLM у нас реально работают в ОДНОМ лейне из трёх - в исследовании. Второе мнение живёт наполовину (за последние двое суток почти все прогоны были тестовыми, а не боевыми), а лейн, ради которого весь режим и затевался - «код пишут внешние LLM» - стоит вторые сутки: последняя запись в леджере 04.08, при том что неделя 1 пилота идёт до 09.08.
Лейн 1. Исследование - ДР-веер (живёт лучше всех)
49 карточек тронуто за 7 дней, 42 из них с отчётами, 7 свежих ещё в работе. Считаем, кто из рельс реально доставил отчёт.
| Рельса | Доставила отчётов | Доля карточек | | Состояние |
| ChatGPT | 41 | 98% | | рабочая лошадь |
| Grok | 40 | 95% | | рабочая лошадь |
| Gemini | 13 | 31% | | через раз |
| GLM (z.ai) | 3 | 7% | | только вручную через веб |
| Mistral Le Chat | 0 | 0% | | аккаунта нет (регистрация за Антоном) |
Кворум 4 из 6 не выполняется. Из 42 карточек с отчётами четыре и более рельсы набрали только 3 карточки (7%). Типичный ДР - это 2 рельсы: 27 карточек. То есть по бумаге у нас шестирельсовый веер, по факту - дуэт ChatGPT + Grok, а «независимость источников» держится на двух вендорах.
Оговорка честности: в карточке не записано, сколько целей было ЗАКАЗАНО. Часть ДР заказывалась на 2-3 цели, и для них 2 отчёта - это не недобор. Отдельная дыра: заказ не фиксируется, значит недобор нельзя отличить от малого заказа автоматически.
Лейн 2. Второе мнение и /tt-панель (снимок HP17, 06.08 — свежие хабовые цифры см. «Архитектура рельс» выше)
92 боевых вызова с 21.07 по 05.08 (плюс 72 тестовых прогона - они в цифры ниже НЕ входят).
| Движок | Боевых вызовов | Отработал без ошибки | Доля успеха |
| Codex (писатель №1) | 61 | 41 | 67% |
| Gemini | 17 | 16 | 94% |
| Grok | 13 | 11 | 85% |
| GLM | 1 | 1 | выборка 1 |
- Ритуалы:
/tt 68 вызовов, implement 11, panel 6, без метки 7.
- Находки в 60 вызовах из 92 (65%) - то есть в двух случаях из трёх внешний ломатель что-то реально сказал, а не отписался.
- Codex - худший по надёжности из всех рельс (67%), при том что именно он назначен писателем №1. Это не про качество текста, а про то, что вызов срывается: таймауты, отказ песочницы, пустой выход.
- За последние двое суток (05-06.08) боевых вызовов всего 4, зато 72 тестовых. Панель в эти дни чинили, а не использовали.
Лейн 3. Аутсорс написания кода - тот самый режим (снимок HP17, 06.08)
| Метрика | Аутсорс (Codex) | База (пишу я) | Вывод |
| Задач в окне 7 дней | 5 | 2 | выборка мала |
| Токенов оркестратора на задачу | 6 800 | 25 500 | экономия 73% |
| Доля переделок | 20% (1 из 5) | 0% (0 из 2) | хуже базы |
Вердикт /tt | ok 6, partial 1, fail 0 (85.7%) | приемлемо |
| Кругов правок | среднее 1.29, максимум 3, на капе 2 - две задачи | кап держится |
ФЛИП: НЕТ. Экономия токенов огромная (73%, при цели 30%), но доля переделок у аутсорса выше базы, а критерий флипа требует «без роста переделок». И главное - с 04.08 в леджер не легло ни одной новой задачи, хотя неделя 1 пилота идёт до 09.08. Пилот не провалился по цифрам, он просто остановился.
Что сломано и держит лейн 3
| Дыра | Состояние на 06.08 12:40 | Кто чинит |
Писатель не может прогнать тест в песочнице codex exec -s workspace-write нет питона: PATH пользователя срезан, запуск из AppData запрещён | ПОЧИНЕНО 06.08 12:5x. Машинный Python 3.11.9 в C:\Program Files + обёртка сама подмешивает его в PATH писателя. Боевое доказательство: писатель прогнал python demo.py и вернул 4. Гейт _test_writer_env_python.py, флоту раскатано посылкой sandbox-python-path-20260806 | закрыто |
| Cursor не залогинен | CLI и IDE стоят, регистрация упирается в SMS-верификацию телефона | физически руки Антона |
| Antigravity (agy) не залогинен | стоит 1.1.10, окно вставки OAuth-кода 60 секунд против латентности агента; оснастка agy_auth.ps1 готова | я |
| Mistral - шестая рельса | аккаунта Le Chat нет | регистрация за Антоном |
| Заказ рельс в ДР не фиксируется | в карточке нет списка заказанных целей, только доставленные отчёты - недобор кворума нельзя отличить от малого заказа | я, правка dr_start.py |
Что это значит для решения
- Неделю 2 (добавить Grok Build писателем) включать рано. Неделя 1 недожата: 5 задач вместо ежедневного потока, и двое суток простоя. Сначала добить неделю 1 боевыми задачами.
- Cursor Pro $20 не покупаем. Условие недели 3 было «многофайловые задачи накопились в леджере». В леджере 7 строк и ноль многофайловых. Цифр за покупку нет.
- Питон в песочнице закрыт сегодня - но это значит, что все 7 строк леджера сняты в условиях, когда писатель НЕ мог краснить свой тест. Их «first-pass ok» завышен, и честно сравнивать можно только задачи с 06.08 и дальше. Прежние цифры оставляем в леджере как есть, но помечаем как снятые до починки.
- Веер ДР надо честно назвать двухрельсовым либо добить Gemini и GLM до автоматических. Сейчас «кворум 4 из 6» - правило, которое машина не исполняет и никто не краснеет.