LLM-разработка: сравнение подходов RAG, fine-tuning и промптинга
Три команды приносят три разных счёта за одну и ту же задачу. Промпт-инжиниринг в нашей практике стоит 80–250 тыс. ₽ и делается две-три недели. Контур с поиском по документам — 600 тыс. – 1,5 млн ₽ и полтора…
Три команды приносят три разных счёта за одну и ту же задачу. Промпт-инжиниринг в нашей практике стоит 80–250 тыс. ₽ и делается две-три недели. Контур с поиском по документам — 600 тыс. – 1,5 млн ₽ и полтора месяца. Дообучение модели на ваших данных — от 900 тыс. ₽ и вверх, если считать разметку и GPU-часы. LLM разработка начинается с выбора между этими путями, и ошибка на старте стоит дороже, чем ошибка в коде.
Ниже — сравнение подходов по деньгам и срокам, разбор типовых задач и чек-лист из пяти вопросов, который за десять минут показывает, какой путь вам нужен. Плюс честно о том, где дообучение не помогает вообще, сколько бы денег в него ни вложили.
Ключевые выводы
- Промпты решают 60–70% корпоративных задач: 80–250 тыс. ₽ на разработку и 2–4 недели, обновление занимает часы.
- RAG нужен, когда ответ лежит в документах: 600 тыс. – 1,5 млн ₽, срок 4–8 недель, точность на подготовленном корпусе 90–95%.
- Дообучение оправдано для стиля, формата и узкой терминологии: от 900 тыс. ₽, требует 500–3 000 размеченных примеров и переобучения при изменениях.
- Комбинированная схема «RAG + дообучение» обходится в 1,8–3,5 млн ₽ и окупается только при потоке от 30 тыс. запросов в месяц.
- Эксплуатация LLM-контура — 30–120 тыс. ₽ в месяц, из них на токены уходит 15–60 тыс. ₽ при 20–40 тыс. диалогов.
- Разработка моделей ии с нуля под бизнес-задачу экономически бессмысленна: открытая модель плюс настройка обходятся дешевле на два порядка.
LLM разработка: три подхода и их отличия
Промптинг — это управление поведением модели через инструкцию: роль, ограничения, формат ответа, примеры. Вы не меняете модель, только то, что ей подаётся на вход.
RAG — это подстановка в контекст найденных фрагментов ваших документов. Модель отвечает по источникам и ссылается на них.
Дообучение (fine-tuning) — это изменение весов модели на ваших примерах. Модель усваивает стиль и закономерности, но не получает новых фактов надёжно.
Ключевая разница в том, что именно вы пытаетесь передать модели. Формат и манеру — дообучением. Знания — поиском. Правила поведения — промптом. Большинство провальных проектов выросли из попытки решить знаниями то, что решается инструкцией.
| Критерий | Промпты | RAG | Дообучение |
|---|---|---|---|
| Стоимость на старте | 80–250 тыс. ₽ | 600 тыс. – 1,5 млн ₽ | от 900 тыс. ₽ |
| Срок до первой версии | 2–4 недели | 4–8 недель | 6–12 недель |
| Нужны данные | нет | документы, 100+ штук | 500–3 000 размеченных примеров |
| Обновление знаний | переписать промпт | переиндексировать раздел | переобучить и перепроверить |
| Стоимость обновления | часы | часы – дни | недели + GPU-часы |
| Ссылки на источник | нет | да, с точностью до страницы | нет |
| Риск выдумок | средний | низкий | средний и выше |
Как выбрать подход под задачу
Прямой ответ: смотрите не на технологию, а на тип знания. Если правило помещается в инструкцию — промпт. Если ответ живёт в документе — RAG. Если важна манера и терминология — дообучение.
Промпты: 80% первых проектов
Стартовать стоит здесь почти всегда: llm разработка в большинстве проектов начинается именно с промпта. Классификация обращений, извлечение полей из письма, генерация описания товара, суммаризация звонка, черновик ответа — всё это закрывается инструкцией и парой десятков примеров внутри промпта. Разработка ии в таком формате укладывается в 2–4 недели, и уже на этом этапе видно, тянет ли модель задачу.
Границы: промпт не добавит модели знаний, которых у неё нет, и плохо держит длинные инструкции. Если в промпте больше 15 правил с исключениями, качество начинает падать — пора выносить часть логики в код.
RAG: когда ответ в документах
Типовые задачи — поддержка по продуктовой документации, внутренние регламенты, работа с договорами, поиск по базе знаний. Схема описана подробно в материале RAG для бизнеса, здесь важна экономика: контур стоит 600 тыс. – 1,5 млн ₽, но окупается за 4–7 месяцев при потоке от 1 500 обращений в месяц.
Дообучение: узкая полка применения
Fine-tuning решает три задачи. Первая — жёсткий формат вывода, который промптом держится нестабильно: например, генерация коммерческих предложений по шаблону с десятком условных блоков. Вторая — отраслевая терминология, которую базовая модель коверкает. Третья — сокращение длины промпта: вместо 3 000 токенов инструкций вы получаете компактную модель, и стоимость запроса падает в 2–4 раза при больших объёмах.
Технически это доступно: открытые модели класса Qwen и Llama дообучаются на одной видеокарте за несколько часов. Проблема не в обучении, а в данных. Разметка 1 000 качественных примеров — это 2–4 недели работы эксперта и 150–400 тыс. ₽.
Сколько стоит каждый путь в 2026 году
Прямой ответ: от 80 тыс. ₽ за промпт-проект до 3,5 млн ₽ за комбинированную систему. Разница в цене — это разница в объёме работ, а не в «крутости» технологии.
| Статья расходов | Промпты | RAG | Дообучение |
|---|---|---|---|
| Аналитика и постановка | 40–80 тыс. ₽ | 80–180 тыс. ₽ | 80–180 тыс. ₽ |
| Разработка | 40–120 тыс. ₽ | 250–700 тыс. ₽ | 350–900 тыс. ₽ |
| Данные и разметка | — | 150–400 тыс. ₽ | 150–400 тыс. ₽ |
| Интеграции | 0–150 тыс. ₽ | 200–700 тыс. ₽ | 150–400 тыс. ₽ |
| Ежемесячная эксплуатация | 10–30 тыс. ₽ | 30–80 тыс. ₽ | 40–120 тыс. ₽ |
Отдельная строка — тестирование. Набор из 100–300 эталонных примеров с ожидаемыми ответами стоит 60–150 тыс. ₽, и без него вы не отличите улучшение от случайности. В промпт-проектах это часто единственная защита от регресса: поправили одну инструкцию, сломали два соседних сценария.
Создание ии модели с нуля под корпоративную задачу не имеет смысла: обучение большой модели стоит от 40 млн ₽ и требует корпуса в миллиарды токенов. Все рабочие проекты строятся на готовых моделях — облачных или открытых.
Разработка сайта и LLM-контур пересекаются чаще, чем кажется: чат-консультант, умный поиск, генерация описаний в каталоге — всё это живёт на сайте. Сайт разработка с ИИ-функциями почти всегда требует единого подрядчика: если заказывать сайт и ИИ отдельно, споры о том, чей API виноват, съедят недели. Ии для разработки интерфейсов даёт и второй эффект — генерацию текстов для сотен страниц каталога, где копирайтер физически не успевает.
Комбинированные схемы: когда нужны оба подхода
Прямой ответ: комбинация нужна, когда у задачи две независимые части — знания и форма. Например, ассистент техподдержки, который отвечает по 4 000 страниц документации строго в корпоративном тоне с обязательной структурой ответа.
Схема: RAG достаёт три релевантных фрагмента, дообученная модель собирает из них ответ по вашему шаблону. Стоимость — 1,8–3,5 млн ₽, срок 3–5 месяцев. Окупается при потоке от 30 тыс. запросов в месяц или при высокой цене ошибки: в медицине, промышленной безопасности, финансовом консалтинге.
Есть и более дешёвый вариант той же идеи: RAG плюс жёсткая постобработка ответа кодом. Шаблон, проверка обязательных полей, отказ при отсутствии цитаты. Это добавляет 80–200 тыс. ₽ к смете и снимает большую часть проблем с форматом без дообучения.
Где подходы ломаются: честный список
Дообучение не даёт новых фактов. Модель, обученная на прайсе от января, не узнает о повышении цен в марте — она будет уверенно называть старые цифры. Знания обновляются поиском, а не весами.
RAG не работает на пустой базе. Пять документов и три ответа в почте — это не корпус. Контур начнёт выдавать случайные фрагменты и подводить под них ответ.
Промпты не терпят противоречивых требований. «Отвечай коротко и подробно», «будь дружелюбным, но официальным» — модель выберет одно и будет делать это непоследовательно. Каждое правило должно быть проверяемым.
И общее ограничение для всех трёх путей: LLM плохо считает. Если в задаче есть арифметика по договору, расчёт скидки или сверка сумм, вычисления стоит выносить в код, а модель использовать только для формулировки результата. Разработка ии решений без этого разделения регулярно даёт красивые ответы с неверными числами.
Чек-лист выбора: пять вопросов
- Ответ на вопрос есть в ваших документах? Да — RAG или промпт с подстановкой; нет — промпт или дообучение.
- Нужна ссылка на источник? Если да, альтернативы RAG нет: только он даёт цитату с точностью до фрагмента.
- Важна ли стабильность формата сильнее, чем гибкость? Да — думайте про дообучение; нет — хватит промпта с валидацией.
- Сколько запросов в месяц? До 5 000 — промпт плюс RAG; от 30 000 — считайте экономию на дообучении, оно снижает цену запроса.
- Есть ли 500+ размеченных примеров и кто их разметит? Нет — дообучение откладывается, начинайте с RAG.
Если по ответам получается две-три технологии сразу, не смешивайте их в одном релизе. Сначала промпт и приёмка на эталонном наборе, потом поиск, и только затем — тонкая настройка модели. Каждый следующий слой добавляется, когда предыдущий перестал давать прирост качества.
Частые вопросы
Что дешевле: RAG или дообучение?
RAG на старте дешевле в 1,5–2 раза: 600 тыс. – 1,5 млн ₽ против 900 тыс. ₽ и выше у дообучения. В эксплуатации RAG тоже обычно обходится дешевле. Дообучение выигрывает при больших объёмах, когда короткий промпт экономит токены.
Можно ли обойтись только промптами?
Для 60–70% задач — да. Классификация, извлечение данных, генерация текстов, суммаризация и черновики ответов закрываются инструкцией и примерами. Промпты перестают справляться, когда нужны факты из документов или жёсткая стабильность формата на тысячах запросов.
Сколько данных нужно для дообучения?
Рабочий минимум — 500 качественных примеров «вход — правильный выход», оптимум 1 500–3 000. Разметка такого набора занимает 2–4 недели и стоит 150–400 тыс. ₽. На 100 примерах модель переобучится и начнёт повторять их дословно.
Как часто нужно переобучать модель?
Если меняются продукты, цены или регламенты — переобучение не помогает, нужен поиск по актуальным документам. Само дообучение обновляют раз в 3–6 месяцев либо при смене формата ответов. Каждый цикл — это 2–4 недели, включая проверку на эталонном наборе.
Подходит ли открытая модель для бизнес-задачи?
Да, и часто это выгоднее облака. Открытые модели класса Qwen и Llama дают контроль над данными, а стоимость своего GPU-сервера — от 90 тыс. ₽ в месяц. Облачные YandexGPT и GigaChat быстрее на старте и снимают вопросы хранения персональных данных в вашем контуре.
Что делать, если модель выдумывает факты?
Ограничить её источниками: отвечать только по найденным фрагментам и отказываться при их отсутствии. Добавить проверку цитаты в коде, снизить температуру генерации и ввести обязательный отказ на вопросы вне базы знаний. Если выдумки остаются, разберите причины подробнее в материале про галлюцинации нейросетей.
Что делать дальше
Начните с промпт-прототипа на 50–100 реальных примерах из вашего процесса. Это 2–3 недели и 80–150 тыс. ₽, и результат сразу покажет, нужен ли следующий слой. Параллельно соберите эталонный набор ответов — он понадобится на любой из трёх дорог и окупится на первой же приёмке.
Если прототип упирается в знания, переходите к контуру с поиском; если в формат и объёмы — считайте дообучение. Посмотреть, как это выглядит в проектах, можно в разделе ИИ-агенты и чат-боты, а если ИИ нужен как часть клиентского интерфейса — в разделе разработка сайтов. И держите в голове главное правило: llm разработка выбирается по типу знания, а не по размеру бюджета — лишний слой добавляет не только деньги, но и точки отказа.
Частые вопросы
Что дешевле: RAG или дообучение?
Можно ли обойтись только промптами?
Сколько данных нужно для дообучения?
Как часто нужно переобучать модель?
Подходит ли открытая модель для бизнес-задачи?
Что делать, если модель выдумывает факты?
Статья основана на практике проектов НейроДела и данных Яндекс Вордстата по кластеру «ИИ-агенты и ИИ-боты». Основной запрос материала — «llm разработка» (516 показов в месяц). Если у вас другая ситуация — напишите, разберём.

