⌂ все дашборды/Флот и узлы← Content-Machine-Map · Dashboards-On-Hub-Rollout →

Какая LLM реально выучит твой голос

DR26-08-04-ZB-12-2205 · корпус 100–200 МБ (RU+EN) · собрано 3 рельсы из 5 (grok, gemini, chatgpt), claude.ai и GLM в работе · прочитаны и сведены grok + gemini
Главный выводНе вендорский fine-tune
Открытые веса + обучение у себя
МетодCPT на BASE-модели
дообучение на сыром тексте, не на парах «вопрос-ответ»
МодельQwen3-8B-base / T-lite
русскоязычные базы, 7–9B
Цена$50–400
пилот на твоей 5060 Ti = $0, полный проход на аренде H100

Почему промпт не работает, а это — сработает

ПодходЧто делаетПочему не даёт «твой голос»Вердикт
Промпт «пиши в стиле Антона»копирует поверхностные маркеры: строчные, короткие фразы, пара словечекраспределение слов остаётся модельным — выходит гладко-LLM-ноето, что есть сейчас
SFT на парах «задание → твой пост»учит формату ответаиз 100–200 МБ в пары превращается 5–20%, остальное выбрасываетсятолько как второй шаг
DPO/ORPO «твоё vs модельное»штрафует за чужой голосшлифует, но сам по себе голос не ставиттретий шаг, опционально
CPT / DAPT на сыром корпусеобычное дообучение предсказанию следующего слова на всём твоём текстеядро решения

Ключевая арифметика обеих рельс: 100–200 МБ ≈ 25–50 млн токенов. Для инструкционного SFT это абсурдно много (там норма 1–5 тыс. примеров), для CPT — ровно нужный размер: каждый токен становится обучающей меткой.

Вторая важная развилка: BASE, а не instruct

Дообучать надо base-чекпоинт (сырая предобученная модель), а не «инструктивную» чат-версию. У чат-версий есть «аттрактор ассистента» — их специально дрессировали быть вежливым помощником, и этот приор дерётся с твоим голосом. Порядок: CPT на base → лёгкий SFT, чтобы слушалась команд → опционально DPO. Обе рельсы независимо сошлись; уверенность emerging.

Базовые модели — что брать

СемействоВпитывает голосРусскийVRAM обучить (QLoRA 7–9B)VRAM крутить
Qwen3 / Qwen2.5 7–14B baseвысокосильный10–14 ГБ6–10 ГБ
T-lite (на Qwen, от Т-Банка)высоко — карточка прямо говорит «для дообучения»очень сильный10–14 ГБ6–10 ГБ
Vikhr / Vikhr-Nemo ~12Bвысокосильный14–16 ГБ (впритык)8–12 ГБ
T-pro ~32Bвысокоочень сильныймультиGPU / аренда20+ ГБ
Llama 3.x 8B baseвысокослабее без доучивания русскому10–14 ГБ6–10 ГБ
Mistral / Gemma / Phi / OLMoсредне-высокосреднийвлезаетвлезает
YandexGPT / GigaChatснаружи никактоптолько API

Размерная кривая: для поста на 80–200 слов 7–14B в твоём голосе бьёт 70B в общем голосе. Ломается на длинных рассуждениях, коде, фактах о твоей жизни (там нужен RAG, а не дообучение).

Вендорские fine-tune API — почему мимо

ВендорДоступен?CPT на сыром тексте?Веса заберёшь?Годится для цели
OpenAIдля новых пользователей сворачиваютнет, только SFT/DPO/RFTнетплохо
Google Vertex / Geminiданет, LoRA-SFT; рекомендуют 100–500 примеровнетчастично — файл до 1 ГБ примет, но метод не тот
Anthropic Claudeпубличного self-serve FT не нашлинедоступно
xAI / Grokпубличного FT API нетнет
MistralдаSFT-подобноезависиттак себе
Together AIдаполный FT приближаетда, скачиваешьлучший облачный путь

Убийственный аргумент: чтобы влезть в вендорский SFT, 100–200 МБ придётся ужать до 500–5000 примеров. Выбрасывается ровно та масса, ради которой всё затевалось → получишь поверхностный стиль, а не голос по умолчанию.

Четыре рецепта

A · дешёвый, за неделю Qwen3-8B-base или T-lite · чистый подкорпус 2–5 ГБ (только самый «твой» FB-голос) · Unsloth CPT QLoRA r=64–128, 1 эпоха · потом лёгкий SFT 1–3 тыс. пар

железо: твоя 5060 Ti 16 ГБ · время: 1–3 дня данные + 0.5–2 дня обучение · $0–50 электричества
результат: заметный сдвиг, слепой тест скорее всего ещё не пройдёт
B · рекомендация ★ T-lite / Qwen3-8B-base · CPT на полном чистом корпусе 1–2 эпохи → SFT (твои пары + ~10% общих) → DPO (ты против базовой модели)

железо: пилот на 16 ГБ, полный проход — аренда 1×H100 на 10–40 ч · $50–400 · веса твои, лежат дома
это и есть ответ на вопрос
C · максимум качества 14–32B русская база (T-pro класс) · полный FT или LoRA высокого ранга на 4–8×A100/H100 · многораундовый DPO

$1 000–10 000+
против принципа АК-47: сложно чинить
D · только вендор Gemini/OpenAI SFT на 1–20 тыс. пар из лучших постов

когда: нужен хостинг и нет GPU
не жди двойника — получишь поверхностный стиль

Что мерить, прежде чем звать людей на слепой тест

МетрикаЧто показывает
Классификатор авторства на отложенных постахпризнаёт ли машина сгенерённое за твоё
Стилометрия (Burrows Delta, служебные слова, длины фраз, пунктуация)совпал ли отпечаток письма
Perplexity на отложенном твоём тексте vs базовая модельсдвинулось ли само распределение
MAUVEнасколько распределения текстов близки
Слепой A/B на людях, которые тебя знаютфинальный судья

Главные риски

ЗабываниеПосле стиль-обучения модель может разучиться слушаться команд и рассуждать. Лечится подмешиванием ~10% общих инструкций и KL/replay-регуляризацией.
ЗубрёжкаМодель начнёт дословно выплёвывать твои старые приватные посты. Лечится дедупом, 1–2 эпохами, чисткой персональных данных до обучения.
Голос на 200 токеновНачало в голосе, дальше сползает в базовый. Признак того, что взяли SFT вместо CPT или слишком низкий ранг LoRA.
Судьи цепляются за факты, а не за стильСлепой тест провалится не из-за голоса, а из-за незнания твоей биографии. Лечится RAG поверх модели, не дообучением.

Честный контраргумент

Сильная альтернатива, которую обе рельсы велели не выбрасывать: сильная база + подтягивание твоих реальных постов в контекст + маленькая модель-переписчик сверху. Дешевле, обратимо, и если мини-A/B на 20 текстах покажет, что люди уже не отличают — CPT можно не запускать вообще. Поэтому первым шагом идёт замерная стойка, а не обучение.

Что делать по шагам

🧒 Простыми словами
Сейчас мы просим модель «говори как Антон» — она надевает твою маску: пара словечек, короткие фразы, а под маской всё равно робот.

Чтобы она заговорила твоим голосом по-настоящему, маску надо снять и переучить саму привычку говорить. Для этого твои 100–200 МБ текста скармливают модели как обычное чтение — она просто читает тебя и учится угадывать, какое слово ты скажешь следующим. Это называется CPT.

Три вещи из отчётов: (1) брать надо «сырую» модель, а не ту, что уже выдрессировали быть вежливым помощником — иначе твой голос дерётся с её вежливостью; (2) готовые кнопки «дообучи меня» у OpenAI и Google для этого не годятся — они заставят выбросить 95% твоего текста; (3) маленькая модель на 8 миллиардов, зато с твоим голосом, для постов лучше огромной чужой.

Пробный заход — на твоей домашней видеокарте, бесплатно. Настоящий — аренда чужой видеокарты на сутки, $50–400. И до всякого обучения надо сделать линейку, которой мы будем мерить, стало ли похоже — иначе спорить будем на ощущениях.