⌂ все дашборды/Люди, привычки, быт← _Life-OS

Шаг 0: у Антона есть почерк — но их два

06.08.2026 · корпус 6.6 МБ / 994 169 слов / ~2.0–2.8 млн токенов · классификатор на 2259 его текстах против 1305 чужих (21 автор) · денег потрачено 0
Гейт почеркапройден
узнаётся даже без тем: AUC 0.917
Корпус на самом деле994 тыс. слов
6.6 МБ, не 100–200 МБ
Токенов2.0–2.8 млн
против 25–50 млн в расчёте ДР
Новоедрейф голоса
тексты 2026 узнаются в 45% против 94% в 2023

Главный вопрос: он узнаётся по манере или по темам?

Это была ловушка №1 всего проекта. Если классификатор ловит Антона только по словам «блокчейн» и «фандрейз» — мы обучим модель его темам, а не голосу. Поэтому каждый прогон сделан трижды: на обычном тексте, с замаскированными содержательными словами, и вообще на одних служебных словах.

ПроверкаОбычный текстТемы замаскированыТолько служебные словаЧто доказывает
5-fold кросс-валидация0.9520.9170.828маскировка почти не роняет — почерк не в темах
Чужие авторы, невиданные при обучении0.9170.8840.764не выучили конкретных людей
Длина текстов выровнена0.9170.825дело не в том, что он пишет длиннее
Только эпоха 2025–2026, обе стороны0.8700.8700.781и сегодняшний Антон отличим от чужих
Контроль: метки перемешаны0.480прибор честный, монетка = монетка

Цифры — AUC. Даже по одним служебным словам (предлоги, союзы, пунктуация, ритм) Антон узнаётся в 0.83 — это и есть идиолект в чистом виде, без единого содержательного слова.

Неожиданное: голос дрейфует, и сильно

ГодДокументовУзнаётся (маскированный)
20172230.951
20183220.922
20202430.885
2023 — целевой голос2090.943
20242390.929
20253690.650
20261040.452
Почему это не «модель просто не видела свежего» Специально прогнали контроль, где свежие тексты тоже были в обучении — узнаваемость всё равно 0.496. То есть свежие тексты объективно меньше похожи на прежнего Антона.

При этом отдельный прогон «только 2025–2026, обе стороны» даёт 0.870. Значит сегодняшний голос узнаваем сам по себе — он просто другой. Стилистически 2023 и 2026 — два разных автора.

Две версии, что это значит — и они требуют разных действий

Версия 1 · корпус загрязнёнЧасть текстов 2025–2026, помеченных как «его», на самом деле написана ассистентами или мной и попала в корпус как его. Тогда мы чуть не обучили модель на роботе — и это же объясняет исходную боль «посты звучат не нативно».

Проверка: взять 30 «его» документов 2026 и посмотреть провенанс глазами.
Версия 2 · стиль реально изменилсяЗа три года он стал писать иначе: другой формат, другие площадки, больше делового и меньше личного.

Тогда решение за Антоном: воспроизводим голос 2023 (как он просил) или сегодняшний.

Что есть в корпусе

СлойИсточникДокументовСлов
A написанное
766 773 слова
Facebook5533484 026
Apple Notes550225 097
Telegram30725 982
заметки волта + прочее54231 668
B устное
227 396 слов
Telegram (наговоренное)3157227 396
ВСЕГО A+B10 089994 169

В токенах: 2.02 млн по многоязычному токенизатору, 2.76 млн по токенизатору GPT-класса. Расчёт ДР строился на 25–50 млн — мы на порядок ниже, и это меняет и метод, и вопрос об аренде GPU.

Что дальше

#ДействиеЗачемЦена
1Разобрать дрейф 2025–2026: провенанс 30 свежих «его» документов вручнуюрешает, какой корпус берём и не учим ли мы модель на роботе$0, вечер
2Догнать RAG-пол — скрипт написан, но не прогнанвторой гейт: если RAG уже проходит, обучение не нужно$0
3Добить ответ хаба про GPU (заказ ушёл, ответа нет)без него не знаем, нужна ли аренда за $200–400$0
4Пилот: Qwen3-base 8B, QLoRA r64 на подкорпусе целевой эпохипервый настоящий замер сдвига$0, карта хаба
5Полный проход — только если пилот сказал «нужно»$20–400
🧒 Простыми словами
Мы проверяли главное: узнаёшь ли ты себя по манере писать, а не по любимым темам. Взяли твои 2259 текстов и 1305 чужих от 21 человека, и специально вычеркнули все содержательные слова — оставили только предлоги, союзы, запятые и ритм. Машина всё равно узнаёт тебя в девяти случаях из десяти. Значит почерк у тебя настоящий, и учить модель есть чему.

Но всплыло странное. Твои тексты 2017–2024 годов машина узнаёт почти всегда, а тексты 2026 года — меньше чем в половине случаев. Мы отдельно проверили, что дело не в незнакомстве: даже когда свежие тексты показывали машине заранее, она их всё равно плохо признавала твоими. Получается, сегодняшний ты пишешь не как ты трёхлетней давности.

Тут два объяснения, и надо выбрать. Либо часть свежих «твоих» текстов в архиве на самом деле написали роботы и подписали тобой — и тогда хорошо, что мы это поймали до обучения, иначе выучили бы робота. Либо ты правда стал писать иначе — и тогда решай ты: делаем голос 2023 года, как ты просил, или сегодняшний.

Денег пока потрачено ноль. Твои $200–400 по-прежнему лежат нетронутыми.