Дообучение модели — донастройка готовой нейросети на собственных примерах, чтобы она отвечала в нужном формате и учитывала специфику компании. Настроить модель под себя можно 3 способами, и дообучение из них самое дорогое и самое медленное. Небольшой компании оно требуется редко.
Путаница возникает из-за слова «обучение»: кажется, что модель надо чему-то научить, иначе она не поймёт бизнес. На практике готовая модель уже умеет писать, считать и рассуждать — ей не хватает контекста и правил. Контекст даётся текстом запроса и документами, правила — инструкцией. Дообучение меняет саму модель и оправдано там, где инструкции упираются в потолок.
Что происходит при дообучении и что не происходит#
Внутри модели — миллиарды числовых параметров, настроенных на огромном массиве текстов. Дообучение берёт готовые параметры и сдвигает их на ваших примерах: запрос и эталонный ответ к нему, размеченные документы, принятые и отбракованные варианты. Модель не запоминает набор как справочник, а перенимает манеру: структуру ответа, тон, состав обязательных полей.
Отсюда главное ограничение. Дообучение хорошо ставит форму и плохо ставит факты. Поменялся прайс — модель с новыми ценами сама не появится, их надо подать в запросе или подключить к поиску по документам. Попытка вшить цифры в веса заканчивается тем, что модель уверенно называет устаревшие: это одна из причин галлюцинаций нейросети.
Проверяется всё быстро. Возьмите 10 своих типовых запросов и посмотрите, чего не хватает в ответах. Если проблема в форме — не тот тон, лишние вступления, забытые пункты, — дообучение поможет. Если проблема в фактах — не знает ассортимент, путает условия договора, не видит остатки, — нужны документы и доступ к данным, а не тренировка.
3 способа настроить модель под свой бизнес#
Первый способ — инструкция. Вы описываете роль, задачу, ограничения и даёте 2–3 образца хорошего ответа прямо в тексте запроса. Это бесплатно, правится за минуты и откатывается так же быстро. Начинать стоит отсюда: как устроено само задание и из каких частей оно собирается, разобрано в материале про промпт.
Второй способ — своя база знаний. Регламенты, прайсы, договоры и переписку складывают в хранилище, а перед ответом система находит нужные куски и подкладывает их в запрос. Факты остаются в файлах: поменяли документ — ответы изменились сразу, без всякого переобучения. Для большинства задач небольшой компании связки «инструкция плюс база» хватает.
Третий способ — собственно дообучение. Модель прогоняют по вашему набору примеров, и она меняется навсегда: отвечает короче, в вашем формате, вашей терминологией, без длинных инструкций в каждом запросе. Плата за это — подготовка данных, счёт за обучение и отдельная версия модели, которую надо где-то держать и переделывать при каждом изменении требований.
Когда дообучение оправдано, а когда деньги на ветер#
Дообучение окупается на узкой, массовой и однообразной задаче. Признаки такие: одна операция повторяется сотни раз в неделю, результат нужен строго в одном виде, а в архиве уже лежат правильные ответы за прошлые периоды. Классификация обращений, разбор заявок по полям, короткие ответы по устоявшемуся шаблону — типичные кандидаты.
Второй сценарий — экономика объёма. Длинная инструкция с примерами оплачивается в каждом запросе и замедляет ответ. Когда запросов много, дообученная модель поменьше даёт тот же результат дешевле и быстрее, потому что инструкция уже внутри неё. Считать это надо на реальном месячном объёме, а не на тестовых 20 обращениях за вечер.
Браться не стоит, если задача формулируется по-новому каждый раз, факты меняются чаще раза в месяц, а размеченного архива нет: собрать его вручную дороже, чем написать инструкцию. Ещё один стоп-сигнал — требования к ответу не устоялись. Дообучать модель под правила, которые перепишут через 2 недели, значит оплатить одну и ту же работу дважды.
Что подготовить: данные, бюджет и сроки проекта#
Работа начинается не с обучения, а со сбора данных. Нужен архив реальных случаев: обращение клиента или сотрудника и ответ, который вы считаете эталонным. Из архива вычищают персональные данные, убирают дубли и противоречия. Если на один и тот же вопрос лежат 2 разных правильных ответа, модель научится не правилу, а тому, чтобы путаться.
Дальше тестовый набор. Отложите часть примеров, которые в обучении участвовать не будут, и прогоните через них обычную модель с хорошей инструкцией. Получится базовая планка. Без неё нельзя честно сказать, что дообучение что-то улучшило: сравнивать придётся с ощущениями, а ощущения обманывают.
Бюджет закладывайте не на само обучение — оно обычно самая дешёвая часть, — а на подготовку данных, оценку результата и поддержку. Требования меняются, значит цикл повторится, и не один раз. Заранее назначьте человека, который отвечает за качество набора примеров: без него проект встаёт на первом же спорном случае, когда двое сотрудников по-разному считают ответ правильным.
Вывод: дообучение — последний шаг, а не первый#
Дообучение модели — инструмент донастройки поведения, а не способ загрузить в нейросеть знания о компании. Оно меняет форму ответа: тон, структуру, терминологию, стабильность формата. Знания живут в документах и базах, к которым модель получает доступ в момент ответа, и обновляются вместе с файлами.
Практический порядок для небольшой компании такой: сначала нормальная инструкция и пара образцов, затем подключение своих документов, и только если после этого остаётся системная ошибка на массовой задаче — разговор про дообучение. К этому моменту у вас уже будет то, без чего оно не делается: набор примеров, понятный критерий качества и цифра по объёму запросов в месяц.
Признак, что пора: задача повторяется ежедневно, ответы проверяет человек, правки у него однотипные и их накопились сотни. Признак, что рано: инструкцию последний раз переписывали на прошлой неделе и она всё ещё меняется. Во втором случае деньги лучше вложить в порядок в документах — от этого выиграют и люди, и модель.