ИИ-агенты и ИИ-боты

LLM-разработка: сравнение подходов RAG, fine-tuning и промптинга

Три команды приносят три разных счёта за одну и ту же задачу. Промпт-инжиниринг в нашей практике стоит 80–250 тыс. ₽ и делается две-три недели. Контур с поиском по документам — 600 тыс. – 1,5 млн ₽ и полтора…

, Архитектор ИИ-решений Обновлено 07.06.2026 10 минут чтения 420 просмотров 20 лайков

Три команды приносят три разных счёта за одну и ту же задачу. Промпт-инжиниринг в нашей практике стоит 80–250 тыс. ₽ и делается две-три недели. Контур с поиском по документам — 600 тыс. – 1,5 млн ₽ и полтора месяца. Дообучение модели на ваших данных — от 900 тыс. ₽ и вверх, если считать разметку и GPU-часы. LLM разработка начинается с выбора между этими путями, и ошибка на старте стоит дороже, чем ошибка в коде.

Ниже — сравнение подходов по деньгам и срокам, разбор типовых задач и чек-лист из пяти вопросов, который за десять минут показывает, какой путь вам нужен. Плюс честно о том, где дообучение не помогает вообще, сколько бы денег в него ни вложили.

Ключевые выводы

  • Промпты решают 60–70% корпоративных задач: 80–250 тыс. ₽ на разработку и 2–4 недели, обновление занимает часы.
  • RAG нужен, когда ответ лежит в документах: 600 тыс. – 1,5 млн ₽, срок 4–8 недель, точность на подготовленном корпусе 90–95%.
  • Дообучение оправдано для стиля, формата и узкой терминологии: от 900 тыс. ₽, требует 500–3 000 размеченных примеров и переобучения при изменениях.
  • Комбинированная схема «RAG + дообучение» обходится в 1,8–3,5 млн ₽ и окупается только при потоке от 30 тыс. запросов в месяц.
  • Эксплуатация LLM-контура — 30–120 тыс. ₽ в месяц, из них на токены уходит 15–60 тыс. ₽ при 20–40 тыс. диалогов.
  • Разработка моделей ии с нуля под бизнес-задачу экономически бессмысленна: открытая модель плюс настройка обходятся дешевле на два порядка.

LLM разработка: три подхода и их отличия

Промптинг — это управление поведением модели через инструкцию: роль, ограничения, формат ответа, примеры. Вы не меняете модель, только то, что ей подаётся на вход.

RAG — это подстановка в контекст найденных фрагментов ваших документов. Модель отвечает по источникам и ссылается на них.

Дообучение (fine-tuning) — это изменение весов модели на ваших примерах. Модель усваивает стиль и закономерности, но не получает новых фактов надёжно.

Ключевая разница в том, что именно вы пытаетесь передать модели. Формат и манеру — дообучением. Знания — поиском. Правила поведения — промптом. Большинство провальных проектов выросли из попытки решить знаниями то, что решается инструкцией.

Критерий Промпты RAG Дообучение
Стоимость на старте 80–250 тыс. ₽ 600 тыс. – 1,5 млн ₽ от 900 тыс. ₽
Срок до первой версии 2–4 недели 4–8 недель 6–12 недель
Нужны данные нет документы, 100+ штук 500–3 000 размеченных примеров
Обновление знаний переписать промпт переиндексировать раздел переобучить и перепроверить
Стоимость обновления часы часы – дни недели + GPU-часы
Ссылки на источник нет да, с точностью до страницы нет
Риск выдумок средний низкий средний и выше

Как выбрать подход под задачу

Прямой ответ: смотрите не на технологию, а на тип знания. Если правило помещается в инструкцию — промпт. Если ответ живёт в документе — RAG. Если важна манера и терминология — дообучение.

Промпты: 80% первых проектов

Стартовать стоит здесь почти всегда: llm разработка в большинстве проектов начинается именно с промпта. Классификация обращений, извлечение полей из письма, генерация описания товара, суммаризация звонка, черновик ответа — всё это закрывается инструкцией и парой десятков примеров внутри промпта. Разработка ии в таком формате укладывается в 2–4 недели, и уже на этом этапе видно, тянет ли модель задачу.

Границы: промпт не добавит модели знаний, которых у неё нет, и плохо держит длинные инструкции. Если в промпте больше 15 правил с исключениями, качество начинает падать — пора выносить часть логики в код.

RAG: когда ответ в документах

Типовые задачи — поддержка по продуктовой документации, внутренние регламенты, работа с договорами, поиск по базе знаний. Схема описана подробно в материале RAG для бизнеса, здесь важна экономика: контур стоит 600 тыс. – 1,5 млн ₽, но окупается за 4–7 месяцев при потоке от 1 500 обращений в месяц.

Дообучение: узкая полка применения

Fine-tuning решает три задачи. Первая — жёсткий формат вывода, который промптом держится нестабильно: например, генерация коммерческих предложений по шаблону с десятком условных блоков. Вторая — отраслевая терминология, которую базовая модель коверкает. Третья — сокращение длины промпта: вместо 3 000 токенов инструкций вы получаете компактную модель, и стоимость запроса падает в 2–4 раза при больших объёмах.

Технически это доступно: открытые модели класса Qwen и Llama дообучаются на одной видеокарте за несколько часов. Проблема не в обучении, а в данных. Разметка 1 000 качественных примеров — это 2–4 недели работы эксперта и 150–400 тыс. ₽.

Сколько стоит каждый путь в 2026 году

Прямой ответ: от 80 тыс. ₽ за промпт-проект до 3,5 млн ₽ за комбинированную систему. Разница в цене — это разница в объёме работ, а не в «крутости» технологии.

Статья расходов Промпты RAG Дообучение
Аналитика и постановка 40–80 тыс. ₽ 80–180 тыс. ₽ 80–180 тыс. ₽
Разработка 40–120 тыс. ₽ 250–700 тыс. ₽ 350–900 тыс. ₽
Данные и разметка — 150–400 тыс. ₽ 150–400 тыс. ₽
Интеграции 0–150 тыс. ₽ 200–700 тыс. ₽ 150–400 тыс. ₽
Ежемесячная эксплуатация 10–30 тыс. ₽ 30–80 тыс. ₽ 40–120 тыс. ₽

Отдельная строка — тестирование. Набор из 100–300 эталонных примеров с ожидаемыми ответами стоит 60–150 тыс. ₽, и без него вы не отличите улучшение от случайности. В промпт-проектах это часто единственная защита от регресса: поправили одну инструкцию, сломали два соседних сценария.

Создание ии модели с нуля под корпоративную задачу не имеет смысла: обучение большой модели стоит от 40 млн ₽ и требует корпуса в миллиарды токенов. Все рабочие проекты строятся на готовых моделях — облачных или открытых.

Разработка сайта и LLM-контур пересекаются чаще, чем кажется: чат-консультант, умный поиск, генерация описаний в каталоге — всё это живёт на сайте. Сайт разработка с ИИ-функциями почти всегда требует единого подрядчика: если заказывать сайт и ИИ отдельно, споры о том, чей API виноват, съедят недели. Ии для разработки интерфейсов даёт и второй эффект — генерацию текстов для сотен страниц каталога, где копирайтер физически не успевает.

Комбинированные схемы: когда нужны оба подхода

Прямой ответ: комбинация нужна, когда у задачи две независимые части — знания и форма. Например, ассистент техподдержки, который отвечает по 4 000 страниц документации строго в корпоративном тоне с обязательной структурой ответа.

Схема: RAG достаёт три релевантных фрагмента, дообученная модель собирает из них ответ по вашему шаблону. Стоимость — 1,8–3,5 млн ₽, срок 3–5 месяцев. Окупается при потоке от 30 тыс. запросов в месяц или при высокой цене ошибки: в медицине, промышленной безопасности, финансовом консалтинге.

Есть и более дешёвый вариант той же идеи: RAG плюс жёсткая постобработка ответа кодом. Шаблон, проверка обязательных полей, отказ при отсутствии цитаты. Это добавляет 80–200 тыс. ₽ к смете и снимает большую часть проблем с форматом без дообучения.

Где подходы ломаются: честный список

Дообучение не даёт новых фактов. Модель, обученная на прайсе от января, не узнает о повышении цен в марте — она будет уверенно называть старые цифры. Знания обновляются поиском, а не весами.

RAG не работает на пустой базе. Пять документов и три ответа в почте — это не корпус. Контур начнёт выдавать случайные фрагменты и подводить под них ответ.

Промпты не терпят противоречивых требований. «Отвечай коротко и подробно», «будь дружелюбным, но официальным» — модель выберет одно и будет делать это непоследовательно. Каждое правило должно быть проверяемым.

И общее ограничение для всех трёх путей: LLM плохо считает. Если в задаче есть арифметика по договору, расчёт скидки или сверка сумм, вычисления стоит выносить в код, а модель использовать только для формулировки результата. Разработка ии решений без этого разделения регулярно даёт красивые ответы с неверными числами.

Чек-лист выбора: пять вопросов

  1. Ответ на вопрос есть в ваших документах? Да — RAG или промпт с подстановкой; нет — промпт или дообучение.
  2. Нужна ссылка на источник? Если да, альтернативы RAG нет: только он даёт цитату с точностью до фрагмента.
  3. Важна ли стабильность формата сильнее, чем гибкость? Да — думайте про дообучение; нет — хватит промпта с валидацией.
  4. Сколько запросов в месяц? До 5 000 — промпт плюс RAG; от 30 000 — считайте экономию на дообучении, оно снижает цену запроса.
  5. Есть ли 500+ размеченных примеров и кто их разметит? Нет — дообучение откладывается, начинайте с RAG.

Если по ответам получается две-три технологии сразу, не смешивайте их в одном релизе. Сначала промпт и приёмка на эталонном наборе, потом поиск, и только затем — тонкая настройка модели. Каждый следующий слой добавляется, когда предыдущий перестал давать прирост качества.

Частые вопросы

Что дешевле: RAG или дообучение?

RAG на старте дешевле в 1,5–2 раза: 600 тыс. – 1,5 млн ₽ против 900 тыс. ₽ и выше у дообучения. В эксплуатации RAG тоже обычно обходится дешевле. Дообучение выигрывает при больших объёмах, когда короткий промпт экономит токены.

Можно ли обойтись только промптами?

Для 60–70% задач — да. Классификация, извлечение данных, генерация текстов, суммаризация и черновики ответов закрываются инструкцией и примерами. Промпты перестают справляться, когда нужны факты из документов или жёсткая стабильность формата на тысячах запросов.

Сколько данных нужно для дообучения?

Рабочий минимум — 500 качественных примеров «вход — правильный выход», оптимум 1 500–3 000. Разметка такого набора занимает 2–4 недели и стоит 150–400 тыс. ₽. На 100 примерах модель переобучится и начнёт повторять их дословно.

Как часто нужно переобучать модель?

Если меняются продукты, цены или регламенты — переобучение не помогает, нужен поиск по актуальным документам. Само дообучение обновляют раз в 3–6 месяцев либо при смене формата ответов. Каждый цикл — это 2–4 недели, включая проверку на эталонном наборе.

Подходит ли открытая модель для бизнес-задачи?

Да, и часто это выгоднее облака. Открытые модели класса Qwen и Llama дают контроль над данными, а стоимость своего GPU-сервера — от 90 тыс. ₽ в месяц. Облачные YandexGPT и GigaChat быстрее на старте и снимают вопросы хранения персональных данных в вашем контуре.

Что делать, если модель выдумывает факты?

Ограничить её источниками: отвечать только по найденным фрагментам и отказываться при их отсутствии. Добавить проверку цитаты в коде, снизить температуру генерации и ввести обязательный отказ на вопросы вне базы знаний. Если выдумки остаются, разберите причины подробнее в материале про галлюцинации нейросетей.

Что делать дальше

Начните с промпт-прототипа на 50–100 реальных примерах из вашего процесса. Это 2–3 недели и 80–150 тыс. ₽, и результат сразу покажет, нужен ли следующий слой. Параллельно соберите эталонный набор ответов — он понадобится на любой из трёх дорог и окупится на первой же приёмке.

Если прототип упирается в знания, переходите к контуру с поиском; если в формат и объёмы — считайте дообучение. Посмотреть, как это выглядит в проектах, можно в разделе ИИ-агенты и чат-боты, а если ИИ нужен как часть клиентского интерфейса — в разделе разработка сайтов. И держите в голове главное правило: llm разработка выбирается по типу знания, а не по размеру бюджета — лишний слой добавляет не только деньги, но и точки отказа.

Частые вопросы

Что дешевле: RAG или дообучение?
RAG на старте дешевле в 1,5–2 раза: 600 тыс. – 1,5 млн ₽ против 900 тыс. ₽ и выше у дообучения. В эксплуатации RAG тоже обычно обходится дешевле. Дообучение выигрывает при больших объёмах, когда короткий промпт экономит токены.
Можно ли обойтись только промптами?
Для 60–70% задач — да. Классификация, извлечение данных, генерация текстов, суммаризация и черновики ответов закрываются инструкцией и примерами. Промпты перестают справляться, когда нужны факты из документов или жёсткая стабильность формата на тысячах запросов.
Сколько данных нужно для дообучения?
Рабочий минимум — 500 качественных примеров «вход — правильный выход», оптимум 1 500–3 000. Разметка такого набора занимает 2–4 недели и стоит 150–400 тыс. ₽. На 100 примерах модель переобучится и начнёт повторять их дословно.
Как часто нужно переобучать модель?
Если меняются продукты, цены или регламенты — переобучение не помогает, нужен поиск по актуальным документам. Само дообучение обновляют раз в 3–6 месяцев либо при смене формата ответов. Каждый цикл — это 2–4 недели, включая проверку на эталонном наборе.
Подходит ли открытая модель для бизнес-задачи?
Да, и часто это выгоднее облака. Открытые модели класса Qwen и Llama дают контроль над данными, а стоимость своего GPU-сервера — от 90 тыс. ₽ в месяц. Облачные YandexGPT и GigaChat быстрее на старте и снимают вопросы хранения персональных данных в вашем контуре.
Что делать, если модель выдумывает факты?
Ограничить её источниками: отвечать только по найденным фрагментам и отказываться при их отсутствии. Добавить проверку цитаты в коде, снизить температуру генерации и ввести обязательный отказ на вопросы вне базы знаний. Если выдумки остаются, разберите причины подробнее в материале про [галлюцинации нейросетей](/blog/gallyucinacii-neyrosetey/).
420 просмотров 1638 слов
Дмитрий Хромов Архитектор ИИ-решений · автор НейроДела

Статья основана на практике проектов НейроДела и данных Яндекс Вордстата по кластеру «ИИ-агенты и ИИ-боты». Основной запрос материала — «llm разработка» (516 показов в месяц). Если у вас другая ситуация — напишите, разберём.

Обсудим вашу задачу?

Разберём процесс, посчитаем экономику и покажем, что реально автоматизировать за первые две недели. Без презентаций на 40 слайдов.