Какая LLM реально выучит твой голос
DR26-08-04-ZB-12-2205 · корпус 100–200 МБ (RU+EN) · собрано 3 рельсы из 5 (grok, gemini, chatgpt), claude.ai и GLM в работе · прочитаны и сведены grok + gemini
Главный выводНе вендорский fine-tune
Открытые веса + обучение у себя
МетодCPT на BASE-модели
дообучение на сыром тексте, не на парах «вопрос-ответ»
МодельQwen3-8B-base / T-lite
русскоязычные базы, 7–9B
Цена$50–400
пилот на твоей 5060 Ti = $0, полный проход на аренде H100
Почему промпт не работает, а это — сработает
| Подход | Что делает | Почему не даёт «твой голос» | Вердикт |
| Промпт «пиши в стиле Антона» | копирует поверхностные маркеры: строчные, короткие фразы, пара словечек | распределение слов остаётся модельным — выходит гладко-LLM-ное | то, что есть сейчас |
| SFT на парах «задание → твой пост» | учит формату ответа | из 100–200 МБ в пары превращается 5–20%, остальное выбрасывается | только как второй шаг |
| DPO/ORPO «твоё vs модельное» | штрафует за чужой голос | шлифует, но сам по себе голос не ставит | третий шаг, опционально |
| CPT / DAPT на сыром корпусе | обычное дообучение предсказанию следующего слова на всём твоём тексте | — | ядро решения |
Ключевая арифметика обеих рельс: 100–200 МБ ≈ 25–50 млн токенов. Для инструкционного SFT это абсурдно много (там норма 1–5 тыс. примеров), для CPT — ровно нужный размер: каждый токен становится обучающей меткой.
Вторая важная развилка: BASE, а не instruct
Дообучать надо base-чекпоинт (сырая предобученная модель), а не «инструктивную» чат-версию. У чат-версий есть «аттрактор ассистента» — их специально дрессировали быть вежливым помощником, и этот приор дерётся с твоим голосом. Порядок: CPT на base → лёгкий SFT, чтобы слушалась команд → опционально DPO. Обе рельсы независимо сошлись; уверенность emerging.
Базовые модели — что брать
| Семейство | Впитывает голос | Русский | VRAM обучить (QLoRA 7–9B) | VRAM крутить |
| Qwen3 / Qwen2.5 7–14B base | высоко | сильный | 10–14 ГБ | 6–10 ГБ |
| T-lite (на Qwen, от Т-Банка) | высоко — карточка прямо говорит «для дообучения» | очень сильный | 10–14 ГБ | 6–10 ГБ |
| Vikhr / Vikhr-Nemo ~12B | высоко | сильный | 14–16 ГБ (впритык) | 8–12 ГБ |
| T-pro ~32B | высоко | очень сильный | мультиGPU / аренда | 20+ ГБ |
| Llama 3.x 8B base | высоко | слабее без доучивания русскому | 10–14 ГБ | 6–10 ГБ |
| Mistral / Gemma / Phi / OLMo | средне-высоко | средний | влезает | влезает |
| YandexGPT / GigaChat | снаружи никак | топ | — | только API |
Размерная кривая: для поста на 80–200 слов 7–14B в твоём голосе бьёт 70B в общем голосе. Ломается на длинных рассуждениях, коде, фактах о твоей жизни (там нужен RAG, а не дообучение).
Вендорские fine-tune API — почему мимо
| Вендор | Доступен? | CPT на сыром тексте? | Веса заберёшь? | Годится для цели |
| OpenAI | для новых пользователей сворачивают | нет, только SFT/DPO/RFT | нет | плохо |
| Google Vertex / Gemini | да | нет, LoRA-SFT; рекомендуют 100–500 примеров | нет | частично — файл до 1 ГБ примет, но метод не тот |
| Anthropic Claude | публичного self-serve FT не нашли | — | — | недоступно |
| xAI / Grok | публичного FT API нет | — | — | нет |
| Mistral | да | SFT-подобное | зависит | так себе |
| Together AI | да | полный FT приближает | да, скачиваешь | лучший облачный путь |
Убийственный аргумент: чтобы влезть в вендорский SFT, 100–200 МБ придётся ужать до 500–5000 примеров. Выбрасывается ровно та масса, ради которой всё затевалось → получишь поверхностный стиль, а не голос по умолчанию.
Четыре рецепта
A · дешёвый, за неделю
Qwen3-8B-base или T-lite · чистый подкорпус 2–5 ГБ (только самый «твой» FB-голос) · Unsloth CPT QLoRA r=64–128, 1 эпоха · потом лёгкий SFT 1–3 тыс. пар
железо: твоя 5060 Ti 16 ГБ · время: 1–3 дня данные + 0.5–2 дня обучение · $0–50 электричества
результат: заметный сдвиг, слепой тест скорее всего ещё не пройдёт
B · рекомендация ★
T-lite / Qwen3-8B-base · CPT на полном чистом корпусе 1–2 эпохи → SFT (твои пары + ~10% общих) → DPO (ты против базовой модели)
железо: пилот на 16 ГБ, полный проход — аренда 1×H100 на 10–40 ч · $50–400 · веса твои, лежат дома
это и есть ответ на вопрос
C · максимум качества
14–32B русская база (T-pro класс) · полный FT или LoRA высокого ранга на 4–8×A100/H100 · многораундовый DPO
$1 000–10 000+
против принципа АК-47: сложно чинить
D · только вендор
Gemini/OpenAI SFT на 1–20 тыс. пар из лучших постов
когда: нужен хостинг и нет GPU
не жди двойника — получишь поверхностный стиль
Что мерить, прежде чем звать людей на слепой тест
| Метрика | Что показывает |
| Классификатор авторства на отложенных постах | признаёт ли машина сгенерённое за твоё |
| Стилометрия (Burrows Delta, служебные слова, длины фраз, пунктуация) | совпал ли отпечаток письма |
| Perplexity на отложенном твоём тексте vs базовая модель | сдвинулось ли само распределение |
| MAUVE | насколько распределения текстов близки |
| Слепой A/B на людях, которые тебя знают | финальный судья |
Главные риски
ЗабываниеПосле стиль-обучения модель может разучиться слушаться команд и рассуждать. Лечится подмешиванием ~10% общих инструкций и KL/replay-регуляризацией.
ЗубрёжкаМодель начнёт дословно выплёвывать твои старые приватные посты. Лечится дедупом, 1–2 эпохами, чисткой персональных данных до обучения.
Голос на 200 токеновНачало в голосе, дальше сползает в базовый. Признак того, что взяли SFT вместо CPT или слишком низкий ранг LoRA.
Судьи цепляются за факты, а не за стильСлепой тест провалится не из-за голоса, а из-за незнания твоей биографии. Лечится RAG поверх модели, не дообучением.
Честный контраргумент
Сильная альтернатива, которую обе рельсы велели не выбрасывать: сильная база + подтягивание твоих реальных постов в контекст + маленькая модель-переписчик сверху. Дешевле, обратимо, и если мини-A/B на 20 текстах покажет, что люди уже не отличают — CPT можно не запускать вообще. Поэтому первым шагом идёт замерная стойка, а не обучение.
Что делать по шагам
- 1. Собрать чистый корпус: только твой текст (без репостов и чужих реплик в диалогах), дедуп, вычистить телефоны/пароли/чужие имена, отложить held-out.
- 2. Заморозить замерную стойку (perplexity + стилометрия + классификатор + мини-A/B на 20 текстах) — до обучения.
- 3. Рецепт A на твоей 5060 Ti — сдвинулись ли метрики.
- 4. Сдвинулись → рецепт B: полный корпус на арендованной H100.
- 5. Только потом DPO.
🧒 Простыми словами
Сейчас мы просим модель «говори как Антон» — она надевает твою маску: пара словечек, короткие фразы, а под маской всё равно робот.
Чтобы она заговорила твоим голосом по-настоящему, маску надо снять и переучить саму привычку говорить. Для этого твои 100–200 МБ текста скармливают модели как обычное чтение — она просто читает тебя и учится угадывать, какое слово ты скажешь следующим. Это называется CPT.
Три вещи из отчётов: (1) брать надо «сырую» модель, а не ту, что уже выдрессировали быть вежливым помощником — иначе твой голос дерётся с её вежливостью; (2) готовые кнопки «дообучи меня» у OpenAI и Google для этого не годятся — они заставят выбросить 95% твоего текста; (3) маленькая модель на 8 миллиардов, зато с твоим голосом, для постов лучше огромной чужой.
Пробный заход — на твоей домашней видеокарте, бесплатно. Настоящий — аренда чужой видеокарты на сутки, $50–400. И до всякого обучения надо сделать линейку, которой мы будем мерить, стало ли похоже — иначе спорить будем на ощущениях.