⌂ все дашборды/Люди, привычки, быт← Entity-Lane-AB · Glossary-Anton-Speech →
Как мы используем сторонние LLM (06.08.2026)

Как мы используем сторонние LLM прямо сейчас

Базовый замер 06.08.2026 12:40 (машина HP17); обновление 09.08.2026 12:45, машина A-2022BAYAREA (хаб) — секция «Архитектура рельс» и цифры второго мнения пересчитаны по хабовому леджеру. ⚠️ usage.jsonl и outsource_ledger.jsonl — ПЕР-МАШИННЫЕ: лейны 2-3 ниже описывают тот узел, где сняты (помечено). Источники: _dr/queue (веер ДР, весь флот), cc-review/bridge-state/usage.jsonl, outsource_ledger.jsonl. Всё посчитано скриптом по файлам на диске, ничего по памяти.

Архитектура рельс второго мнения (приказы 06-07.08) — кто за что платит

ЯрусРельсаРольДоказательство, что живо
1. Дефолт тестов и ломателейOpenRouter (4 семьи: GLM-flash, Gemini-flash-lite, DeepSeek-flash, Qwen-coder; ~0.15 цента за панель)панель /tt и QA-разборы: 4 дешёвых мнения из РАЗНЫХ семей вместо 2-3 подписочных (замер 07.08: 4/4 ответили против 2/4 у CLI)09.08 12:38, хаб: первый CLI-прогон panel --rails auto — 4/4 моделей, CLI-бэкап не понадобился
2. Бэкап панелиCLI codex / grok / gemini (подписки)автоматически зовутся, когда OpenRouter дал <2 мнений; мнения СУММИРУЮТСЯ (1 orouter + 1 CLI = кворум)регресс-сетка 21/21, кейсы 9a-9c; мутация краснит
3. Серьёзная работаПодписочные баки (Codex-писатель, DR-веер, стратегические панели --rails cli --role strategy --mode max)мышление и код, где качество важнее цены; OpenRouter сюда НЕ пускаем (платные токены)стратегическая панель мемо 07.08: codex+grok+gemini, кворум с GLM 4/6
4. Ручной резервБраузерные двери (chat.z.ai GLM, веб-вееры)когда headless-двери нет или мертва; вердикт возвращается руками через log-extзамыкание ~8% (24 промпта / 2 вердикта до 07.08) — известная дыра разомкнутой ноги
Новое с 07-09.08: у панели появились --rails auto|orouter|cli|both, --role break|verify|counter|propose|strategy и --mode fast|max (режим доезжает до reasoning-effort вендора: max→high, fast→medium). Хабовый леджер за 7 дней: панельных вызовов 236 (codex 109 · grok 85 · gemini 70) + 19 через OpenRouter + 3 GLM-веб; роли: break 126 · strategy 14; режим max 132 · fast 8.
3
лейна, где живут сторонние LLM
49
ДР-карточек за 7 дней
92
боевых вызовов второго мнения (21.07-05.08)
46 ч
простоя аутсорса кода (последняя задача 04.08 15:23)
Главное одной строкой. Сторонние LLM у нас реально работают в ОДНОМ лейне из трёх - в исследовании. Второе мнение живёт наполовину (за последние двое суток почти все прогоны были тестовыми, а не боевыми), а лейн, ради которого весь режим и затевался - «код пишут внешние LLM» - стоит вторые сутки: последняя запись в леджере 04.08, при том что неделя 1 пилота идёт до 09.08.

Лейн 1. Исследование - ДР-веер (живёт лучше всех)

49 карточек тронуто за 7 дней, 42 из них с отчётами, 7 свежих ещё в работе. Считаем, кто из рельс реально доставил отчёт.
РельсаДоставила отчётовДоля карточекСостояние
ChatGPT4198%рабочая лошадь
Grok4095%рабочая лошадь
Gemini1331%через раз
GLM (z.ai)37%только вручную через веб
Mistral Le Chat00%аккаунта нет (регистрация за Антоном)
Кворум 4 из 6 не выполняется. Из 42 карточек с отчётами четыре и более рельсы набрали только 3 карточки (7%). Типичный ДР - это 2 рельсы: 27 карточек. То есть по бумаге у нас шестирельсовый веер, по факту - дуэт ChatGPT + Grok, а «независимость источников» держится на двух вендорах.
Оговорка честности: в карточке не записано, сколько целей было ЗАКАЗАНО. Часть ДР заказывалась на 2-3 цели, и для них 2 отчёта - это не недобор. Отдельная дыра: заказ не фиксируется, значит недобор нельзя отличить от малого заказа автоматически.

Лейн 2. Второе мнение и /tt-панель (снимок HP17, 06.08 — свежие хабовые цифры см. «Архитектура рельс» выше)

92 боевых вызова с 21.07 по 05.08 (плюс 72 тестовых прогона - они в цифры ниже НЕ входят).
ДвижокБоевых вызововОтработал без ошибкиДоля успеха
Codex (писатель №1)614167%
Gemini171694%
Grok131185%
GLM11выборка 1

Лейн 3. Аутсорс написания кода - тот самый режим (снимок HP17, 06.08)

МетрикаАутсорс (Codex)База (пишу я)Вывод
Задач в окне 7 дней52выборка мала
Токенов оркестратора на задачу6 80025 500экономия 73%
Доля переделок20% (1 из 5)0% (0 из 2)хуже базы
Вердикт /ttok 6, partial 1, fail 0 (85.7%)приемлемо
Кругов правоксреднее 1.29, максимум 3, на капе 2 - две задачикап держится
ФЛИП: НЕТ. Экономия токенов огромная (73%, при цели 30%), но доля переделок у аутсорса выше базы, а критерий флипа требует «без роста переделок». И главное - с 04.08 в леджер не легло ни одной новой задачи, хотя неделя 1 пилота идёт до 09.08. Пилот не провалился по цифрам, он просто остановился.

Что сломано и держит лейн 3

ДыраСостояние на 06.08 12:40Кто чинит
Писатель не может прогнать тест
в песочнице codex exec -s workspace-write нет питона: PATH пользователя срезан, запуск из AppData запрещён
ПОЧИНЕНО 06.08 12:5x. Машинный Python 3.11.9 в C:\Program Files + обёртка сама подмешивает его в PATH писателя. Боевое доказательство: писатель прогнал python demo.py и вернул 4. Гейт _test_writer_env_python.py, флоту раскатано посылкой sandbox-python-path-20260806закрыто
Cursor не залогиненCLI и IDE стоят, регистрация упирается в SMS-верификацию телефонафизически руки Антона
Antigravity (agy) не залогиненстоит 1.1.10, окно вставки OAuth-кода 60 секунд против латентности агента; оснастка agy_auth.ps1 готовая
Mistral - шестая рельсааккаунта Le Chat нетрегистрация за Антоном
Заказ рельс в ДР не фиксируетсяв карточке нет списка заказанных целей, только доставленные отчёты - недобор кворума нельзя отличить от малого заказая, правка dr_start.py

Что это значит для решения