Шаг 0: у Антона есть почерк — но их два
06.08.2026 · корпус 6.6 МБ / 994 169 слов / ~2.0–2.8 млн токенов · классификатор на 2259 его текстах против 1305 чужих (21 автор) · денег потрачено 0
Гейт почеркапройден
узнаётся даже без тем: AUC 0.917
Корпус на самом деле994 тыс. слов
6.6 МБ, не 100–200 МБ
Токенов2.0–2.8 млн
против 25–50 млн в расчёте ДР
Новоедрейф голоса
тексты 2026 узнаются в 45% против 94% в 2023
Главный вопрос: он узнаётся по манере или по темам?
Это была ловушка №1 всего проекта. Если классификатор ловит Антона только по словам «блокчейн» и «фандрейз» — мы обучим модель его темам, а не голосу. Поэтому каждый прогон сделан трижды: на обычном тексте, с замаскированными содержательными словами, и вообще на одних служебных словах.
| Проверка | Обычный текст | Темы замаскированы | Только служебные слова | Что доказывает |
| 5-fold кросс-валидация | 0.952 | 0.917 | 0.828 | маскировка почти не роняет — почерк не в темах |
| Чужие авторы, невиданные при обучении | 0.917 | 0.884 | 0.764 | не выучили конкретных людей |
| Длина текстов выровнена | — | 0.917 | 0.825 | дело не в том, что он пишет длиннее |
| Только эпоха 2025–2026, обе стороны | 0.870 | 0.870 | 0.781 | и сегодняшний Антон отличим от чужих |
| Контроль: метки перемешаны | — | 0.480 | — | прибор честный, монетка = монетка |
Цифры — AUC. Даже по одним служебным словам (предлоги, союзы, пунктуация, ритм) Антон узнаётся в 0.83 — это и есть идиолект в чистом виде, без единого содержательного слова.
Неожиданное: голос дрейфует, и сильно
| Год | Документов | Узнаётся (маскированный) | |
| 2017 | 223 | 0.951 |
|
| 2018 | 322 | 0.922 |
|
| 2020 | 243 | 0.885 |
|
| 2023 — целевой голос | 209 | 0.943 |
|
| 2024 | 239 | 0.929 |
|
| 2025 | 369 | 0.650 |
|
| 2026 | 104 | 0.452 |
|
Почему это не «модель просто не видела свежего»
Специально прогнали контроль, где свежие тексты тоже были в обучении — узнаваемость всё равно 0.496. То есть свежие тексты объективно меньше похожи на прежнего Антона.
При этом отдельный прогон «только 2025–2026, обе стороны» даёт 0.870. Значит сегодняшний голос узнаваем сам по себе — он просто другой. Стилистически 2023 и 2026 — два разных автора.
Две версии, что это значит — и они требуют разных действий
Версия 1 · корпус загрязнёнЧасть текстов 2025–2026, помеченных как «его», на самом деле написана ассистентами или мной и попала в корпус как его. Тогда мы чуть не обучили модель на роботе — и это же объясняет исходную боль «посты звучат не нативно».
Проверка: взять 30 «его» документов 2026 и посмотреть провенанс глазами.
Версия 2 · стиль реально изменилсяЗа три года он стал писать иначе: другой формат, другие площадки, больше делового и меньше личного.
Тогда решение за Антоном: воспроизводим голос 2023 (как он просил) или сегодняшний.
Что есть в корпусе
| Слой | Источник | Документов | Слов |
A написанное 766 773 слова | Facebook | 5533 | 484 026 |
| Apple Notes | 550 | 225 097 |
| Telegram | 307 | 25 982 |
| заметки волта + прочее | 542 | 31 668 |
B устное 227 396 слов | Telegram (наговоренное) | 3157 | 227 396 |
| ВСЕГО A+B | 10 089 | 994 169 |
В токенах: 2.02 млн по многоязычному токенизатору, 2.76 млн по токенизатору GPT-класса. Расчёт ДР строился на 25–50 млн — мы на порядок ниже, и это меняет и метод, и вопрос об аренде GPU.
Что дальше
| # | Действие | Зачем | Цена |
| 1 | Разобрать дрейф 2025–2026: провенанс 30 свежих «его» документов вручную | решает, какой корпус берём и не учим ли мы модель на роботе | $0, вечер |
| 2 | Догнать RAG-пол — скрипт написан, но не прогнан | второй гейт: если RAG уже проходит, обучение не нужно | $0 |
| 3 | Добить ответ хаба про GPU (заказ ушёл, ответа нет) | без него не знаем, нужна ли аренда за $200–400 | $0 |
| 4 | Пилот: Qwen3-base 8B, QLoRA r64 на подкорпусе целевой эпохи | первый настоящий замер сдвига | $0, карта хаба |
| 5 | Полный проход — только если пилот сказал «нужно» | — | $20–400 |
🧒 Простыми словами
Мы проверяли главное: узнаёшь ли ты себя по манере писать, а не по любимым темам. Взяли твои 2259 текстов и 1305 чужих от 21 человека, и специально вычеркнули все содержательные слова — оставили только предлоги, союзы, запятые и ритм. Машина всё равно узнаёт тебя в девяти случаях из десяти. Значит почерк у тебя настоящий, и учить модель есть чему.
Но всплыло странное. Твои тексты 2017–2024 годов машина узнаёт почти всегда, а тексты 2026 года — меньше чем в половине случаев. Мы отдельно проверили, что дело не в незнакомстве: даже когда свежие тексты показывали машине заранее, она их всё равно плохо признавала твоими. Получается, сегодняшний ты пишешь не как ты трёхлетней давности.
Тут два объяснения, и надо выбрать. Либо часть свежих «твоих» текстов в архиве на самом деле написали роботы и подписали тобой — и тогда хорошо, что мы это поймали до обучения, иначе выучили бы робота. Либо ты правда стал писать иначе — и тогда решай ты: делаем голос 2023 года, как ты просил, или сегодняшний.
Денег пока потрачено ноль. Твои $200–400 по-прежнему лежат нетронутыми.