Торговый каталог на 100 000 позиций — пустые описания или копия с сайта поставщика. Ручное написание займёт год работы команды копирайтеров, а регулярные обновления делают процесс бесконечным. Дублированный контент — гарантированный штраф от поисковиков: Яндекс и Google понижают такие страницы. SEO-специалисты видят падение трафика, а менеджеры тратят часы на ручное редактирование каждой карточки. Мы решаем задачу автоматическим парсингом: извлекаем, очищаем, рерайтим и записываем в инфоблоки. В итоге вы получаете уникальные описания без ручного труда — наполнение занимает дни, а не годы.
Наши инженеры подключают парсер к вашему проекту на 1С-Битрикс. Используем инфоблоки v2.0, HL-блоки и ORM. Пишем на PHP 8.1+ с композером и строгой типизацией. Скорость наполнения — до 20 раз быстрее ручного ввода. С AI-рерайтом через GPT экономия бюджета достигает 70% — это втрое дешевле штатного копирайтера. Получите консультацию по автоматизации вашего каталога: мы проанализируем ваши источники и предложим решение.
Источники описаний
Выбор источника определяет качество и правовые риски. Рассмотрим основные варианты:
- Сайт производителя — самый релевантный контент, но часто трудно парсить и содержит copyright. Используйте как основу для рерайта, не как финальный текст.
- Агрегаторы (Яндекс.Маркет, OZON, Wildberries) — большой объём, стандартизированный формат. Те же правовые оговорки.
- Официальные дистрибьюторы — более лояльны к использованию контента, часто заинтересованы в распространении.
- Базы данных производителей (Icecat, Synccentric) — легальный вариант с API, платный, но даёт чистые данные с лицензией.
Парсинг с сайтов производителей часто нарушает авторские права. Чтобы избежать претензий, мы ориентируемся на легальные базы или используем рерайт после извлечения. В договоре фиксируем ответственность за контент.
Как автоматизировать рерайт с помощью AI?
После парсинга сырые описания требуют уникализации. Используем GPT API для генерации переписанного текста. Процесс:
- Парсим исходный контент с источника.
- Очищаем от мусора, оставляем чистый текст.
- Отправляем в GPT с промптом: «Перепиши описание товара, сохрани характеристики и ключевые слова, измени структуру фраз».
- Записываем результат в инфоблок: PREVIEW_TEXT (первый абзац) и DETAIL_TEXT (полный).
- Устанавливаем флаг DESCRIPTION_SOURCE = 'parsed' для отслеживания источника.
Такой подход даёт уникальный контент, не нарушающий авторских прав, и экономит до 70% бюджета на копирайтинг — это десятки тысяч рублей ежемесячно. С AI-рерайтом вы получаете описание, которое поисковики не считают дублем — разница с исходником достигает 80% уникальности. Парсинг с AI-рерайтом окупается за 2–3 месяца.
Почему важно защищать ручные правки?
Менеджеры могут вручную улучшать описания. Не перезаписывать вслепую — добавляем логику:
- Если DETAIL_TEXT пустой — записываем парсинговый текст с флагом DESCRIPTION_SOURCE.
- Если заполнен — пропускаем элемент при обновлении. Флаг отсутствует? Значит, описание правили вручную — не трогаем.
Пример кода: проверка флага
if (empty($arFields['DETAIL_TEXT']) || $arFields['DESCRIPTION_SOURCE'] === 'parsed') {
$el->Update($elementId, ['DETAIL_TEXT' => $newText, 'DESCRIPTION_SOURCE' => 'parsed']);
}
Устранение дублей контента
Дублирование — главная проблема SEO. Решение — рерайт после парсинга. Используйте GPT API для уникализации: отправляйте текст с промптом «перепиши своими словами, сохранив смысл и ключевые слова». Либо нанимайте копирайтеров для выборочной обработки топовых позиций. Второй вариант — использовать несколько источников и смешивать описания через шаблонизатор.
Запись в поля Битрикса
Битрикс разделяет описание на два поля:
- PREVIEW_TEXT — краткое описание (для листинга)
- DETAIL_TEXT — полное описание (для карточки товара)
При парсинге длинного описания: первый абзац → PREVIEW_TEXT, полный текст → DETAIL_TEXT. Тип текста задаётся полями PREVIEW_TEXT_TYPE и DETAIL_TEXT_TYPE (значения: text или html).
Обновление элемента:
$el = new CIBlockElement();
$el->Update($elementId, [
'PREVIEW_TEXT' => $shortDesc,
'PREVIEW_TEXT_TYPE' => 'html',
'DETAIL_TEXT' => $fullDesc,
'DETAIL_TEXT_TYPE' => 'html',
]);
Документация CIBlockElement поможет разобраться с другими методами.
Сравнение источников парсинга
| Источник | Легальность | Уникальность | Стоимость |
|---|---|---|---|
| Сайт производителя | Средняя (зависит от политики) | Высокая | Бесплатно |
| Агрегаторы | Низкая (копия) | Низкая | Бесплатно |
| Дистрибьюторы | Высокая | Средняя | Бесплатно / партнёрство |
| Icecat / Synccentric | Полная лицензия | Высокая | Платный API |
Что входит в работу
- Анализ источников и выбор структуры извлечения
- Разработка парсера с учётом защиты от блокировок
- Очистка и нормализация текста (HTMLPurifier, регулярные выражения)
- Интеграция с инфоблоком: PREVIEW_TEXT и DETAIL_TEXT
- Защита ручных правок через флаг DESCRIPTION_SOURCE
- Тестирование на 100–200 позициях
- Документация и обучение менеджеров
Таймлайн и стоимость
| Этап | Срок |
|---|---|
| Анализ источников, выбор структуры извлечения | 2–4 часа |
| Разработка парсера описаний | 1–2 дня |
| Логика очистки и нормализации текста | 4–8 часов |
| Интеграция с инфоблоком, защита ручных правок | 4–6 часов |
| Тестирование на 100–200 позициях | 4 часа |
Итого: 4–6 рабочих дней. Если нужен рерайт через AI после парсинга — добавьте ещё 1–2 дня на интеграцию с GPT API. Стоимость рассчитывается индивидуально под ваш проект.
Свяжитесь с нами для оценки вашего проекта — наполним каталог за 4–6 дней и сэкономим до 70% бюджета на написание текстов. Получите консультацию по автоматизации каталога: мы проанализируем источники, подберём оптимальное решение и предложим реализацию.







