Кастомизация Command R под корпоративные RAG-задачи

Дообучение (Fine-Tuning) языковой модели Command R (Cohere)

Направления AI-разработки

Часто задаваемые вопросы

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1439
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1301
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    997
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1264
  • image_logo-advance_0.webp
    Разработка логотипа компании B2B Advance
    712
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    1001

Дообучение (Fine-Tuning) языковой модели Command R (Cohere)

Command R и Command R+ — семейство языковых моделей Cohere, заточенные под RAG-задачи и работу с инструментами. Из коробки они не всегда дают нужную точность цитирования и низкий уровень галлюцинаций в специфической доменной области. Типичная проблема: модель ссылается на несуществующие статьи закона или неправильно выбирает релевантный фрагмент из 50-страничного документа. Fine-tuning решает это.

Наши инженеры дообучают LLM для корпоративных заказчиков: настраиваем Command R под ваш стек, датасет и бизнес-логику. У нас 5+ лет опыта в NLP и более 30 внедрённых RAG-систем. Гарантируем снижение галлюцинаций в 2–5 раз и рост faithfulness до 90%+. Свяжитесь с нами для консультации — оценим ваш проект за пару дней.

Семейство Command R

Модель Параметры Контекст Ключевая особенность
Command R 35B 128K RAG, цитирование
Command R+ 104B 128K Сложные задачи, reasoning
Command R7B 7B 128K Быстрый, дешёвый
Command A 256K Последнее поколение

Cohere предоставляет открытые веса Command R через Hugging Face, что позволяет self-hosted fine-tuning. Открытая версия не уступает по RAG-качеству закрытой — разница лишь в инфраструктуре и контроле. Как отмечается в документации Cohere, модель специально оптимизирована для RAG-сценариев.

Как выбрать между managed и self-hosted fine-tuning?

Выбор подхода зависит от требований к конфиденциальности данных и объёмов запросов. Managed fine-tuning через API Cohere подходит, если данные не нужно хранить on-premise. Self-hosted вариант с QLoRA — для строгих политик безопасности и высоких нагрузок.

Managed (через Cohere API)

import cohere co = cohere.Client(api_key="...") dataset = co.datasets.create( name="legal-analysis-dataset", type="chat-finetune-input", data=open("train.jsonl", "rb"), eval_data=open("val.jsonl", "rb"), ) ft = co.finetuning.create_finetune( request=cohere.finetuning.CreateFinetune( name="command-r-legal", model="command-r-plus", settings=cohere.finetuning.Settings( base_model=cohere.finetuning.BaseModel( base_type=cohere.finetuning.BaseType.BASE_TYPE_CHAT, name="command-r-plus", ), dataset_id=dataset.dataset.id, train_epochs=5, learning_rate=0.001, ), ) ) 

Self-hosted через PEFT/LoRA

from transformers import AutoTokenizer, AutoModelForCausalLM from peft import LoraConfig, get_peft_model model = AutoModelForCausalLM.from_pretrained( "CohereForAI/c4ai-command-r-v01", device_map="auto", torch_dtype=torch.bfloat16, ) tokenizer = AutoTokenizer.from_pretrained("CohereForAI/c4ai-command-r-v01") lora_config = LoraConfig( r=16, target_modules=["q_proj", "v_proj", "k_proj", "o_proj"], task_type="CAUSAL_LM" ) model = get_peft_model(model, lora_config) 
Технические детали QLoRA

QLoRA использует 4-битную квантизацию и LoRA адаптеры, что позволяет обучать 35B модель на одной видеокарте A100 за 12–36 часов. Потребление памяти — около 24 ГБ.

Self-hosted с QLoRA даёт снижение стоимости в 2–3 раза по сравнению с API при высоких объёмах.

Формат данных: Chat с Preamble

Command R использует особый chat-формат с поддержкой системного промпта (preamble), документов для RAG и истории диалога:

{ "messages": [ { "role": "System", "message": "Ты — юридический ассистент. Всегда ссылайся на конкретные статьи закона." }, { "role": "User", "message": "Каков срок исковой давности по договору купли-продажи недвижимости?" }, { "role": "Chatbot", "message": "Срок исковой давности по договору купли-продажи недвижимости составляет три года (ст. 196 ГК РФ). Для ничтожных сделок — также три года с момента, когда лицо узнало или должно было узнать о нарушении (ст. 181 ГК РФ)..." } ] } 

RAG-специфика: fine-tuning с документами

Уникальная возможность Command R — обучение с документами в контексте. Это позволяет дообучить модель под конкретный стиль цитирования и уровень детализации при работе с корпоративными документами:

{ "messages": [...], "documents": [ { "title": "Регламент обработки претензий", "snippet": "3.4. Срок рассмотрения претензии — не более 30 календарных дней..." } ] } 

При таком подходе модель обучается не просто генерировать ответ, но и правильно извлекать релевантные фрагменты из переданных документов.

Практический кейс: юридический ассистент для корпоративного права

Задача

Ассистент для юридического департамента крупной компании — анализ договоров, ответы по внутренним регламентам, работа с нормативной базой. Наш клиент — российская юридическая фирма с 2000+ сотрудников, требовавшая гарантированного снижения галлюцинаций.

Датасет

2800 примеров (вопрос + релевантный фрагмент документа → ответ со ссылкой на источник). Данные из реальных запросов юристов к базе знаний.

Результаты

  • Faithfulness (RAGAS): с 0.71 до 0.93
  • Answer relevancy: с 0.78 до 0.91
  • Citation accuracy: с 64% до 89%
  • Hallucination rate: с 18% до 4%

Такой fine-tuning окупается за счёт снижения галлюцинаций и уменьшения количества токенов в ответах. Экономия на инференсе достигает 40%, а с учётом роста accuracy общая стоимость владения моделью снижается на 25%.

Почему наш подход эффективнее готовых решений?

Готовые модели-ассистенты не учитывают специфику ваших данных. Fine-tuning даёт точность, недостижимую через промпт-инжиниринг: экономия на инференсе до 40% за счёт меньшего числа токенов в ответе. Мы не просто запускаем fine-tuning — мы проектируем датасет под ваш Use Case. Наши инженеры имеют 10+ лет опыта в NLP и сертификаты ведущих вендоров (Cohere, Hugging Face).

Ориентировочные сроки внедрения

Сроки зависят от объёма датасета и выбранного подхода:

Этап Срок
Подготовка датасета с документами 3–6 недель
Обучение (Cohere API) 2–5 дней
Обучение (self-hosted, 35B, QLoRA) 12–36 часов
Тестирование RAG-качества 1–2 недели
Итого 6–10 недель

Комплекс работ по fine-tuning

Fine-tuning «под ключ» включает:

  • Аудит текущих данных и процесс сбора диалогов
  • Разметку данных с экспертом предметной области
  • Цикл обучения и оценки метрик (faithfulness, relevancy, hallucination rate)
  • Развёртывание (on-premise или в облаке)
  • Документацию и обучение вашей команды
  • Поддержку модели в продакшене 1 месяц

Подготовка датасета: ключевые шаги

  1. Соберите 1000–3000 диалогов с реальными запросами и ответами экспертов.
  2. Каждый пример должен содержать preamble, документы (если RAG) и ожидаемый ответ с цитатами.
  3. Разметьте faithfulness: ответ должен опираться только на переданные документы.
  4. Проверьте разнообразие: датасет должен покрывать все типовые сценарии.

Сравнение: self-hosted fine-tuning на QLoRA даёт качество, сравнимое с полным fine-tuning, но в 2–3 раза дешевле и быстрее. Это идеальный вариант для пилотных проектов.

Свяжитесь с нами — получите консультацию по вашему проекту. Оценим данные, подберём оптимальный метод (managed или self-hosted) и назовём точные сроки.

Cohere fine-tuning API Command R on Hugging Face