Парсер отзывов: автоматизация сбора и импорта с маркетплейсов

Сбор и импорт отзывов с маркетплейсов: разработка парсера

Разработка и обслуживание любых видов сайтов:

Информационные сайты или веб-приложения
Сайты визитки, landing page, корпоративные сайты, онлайн каталоги, квиз, промо-сайты, блоги, новостные ресурсы, информационные порталы, форумы, агрегаторы
Сайты или веб-приложения электронной коммерции
Интернет-магазины, B2B-порталы, маркетплейсы, онлайн-обменники, кэшбэк-сайты, биржи, дропшиппинг-платформы, парсеры товаров
Веб-приложения для управления бизнес-процессами
CRM-системы, ERP-системы, корпоративные порталы, системы управления производством, парсеры информации
Сайты или веб-приложения электронных услуг
Доски объявлений, онлайн-школы, онлайн-кинотеатры, конструкторы сайтов, порталы предоставления электронных услуг, видеохостинги, тематические порталы

Это лишь некоторые из технических типов сайтов, с которыми мы работаем, и каждый из них может иметь свои специфические особенности и функциональность, а также быть адаптированным под конкретные потребности и цели клиента

Услуги, которые мы предлагаем
Показано 1 из 1Все 2062 услуг
Парсер отзывов: автоматизация сбора и импорта с маркетплейсов
Средний
~3-5 дней

Наши компетенции:

Часто задаваемые вопросы

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1422
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1287
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    984
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1249
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    986
  • image_bitrix-bitrix-24-1c_fixper_448_0.webp
    Разработка веб-сайта для компании ФИКСПЕР
    1000

Сбор и импорт отзывов с маркетплейсов: разработка парсера

Мы разрабатываем парсеры для автоматического сбора отзывов с маркетплейсов. Клиент потерял 30% конверсии из-за устаревших отзывов — ручной сбор занимал часы, данные не обновлялись неделями. Наша команда (5+ лет опыта, более 50 проектов) создала решение, которое собирает отзывы с Wildberries, Ozon, Яндекс.Маркета и других площадок, нормализует их и импортирует в базу магазина. Экономия времени — до 70%. Окупаемость проекта — 2–3 месяца. Закажите разработку парсера для вашего интернет-магазина.

Типичная ситуация: менеджер вручную копирует отзывы с 5 маркетплейсов по 200 товаров — это 8 часов в день. Данные устаревают, клиенты не видят новых отзывов неделями, доверие падает. Парсер забирает отзывы каждые 2 часа, обновляя страницы товаров в реальном времени. Результат: рост конверсии на 15% за первый месяц.

Технически, каждый маркетплейс — своя головная боль. Wildberries даёт JSON API, но с ограничением 1000 отзывов за сессию. Ozon — SPA на Nuxt, где данные подгружаются через GraphQL, приходится эмулировать браузер через Playwright. Яндекс.Маркет меняет структуру раз в полгода, поэтому мы используем адаптивный парсинг с fallback-стратегией. Наш стек — Python для high-load площадок, PHP (Laravel) для интеграции с вашим сайтом.

Поддерживаемые маркетплейсы и методы

Площадка Метод Особенности
Wildberries JSON API Открытый API, пагинация, до 1000 отзывов за сессию
Ozon Playwright SPA, нужна авторизация, медленнее JSON в 50 раз
Яндекс.Маркет Unofficial API Rate limiting, требуется ротация прокси
Google Reviews Places API Платный, официальный, до 5 отзывов за запрос (нужна бизнес-подписка)
Otzovik.com HTML парсинг Капча на массовых запросах, используем решаторы
iHerb HTML / JSON API Структурированный HTML, проще всего

Сравнение методов: JSON-API (Wildberries) обрабатывает 1000 отзывов за 10 секунд, а Selenium на Ozon — те же 1000 за 5 минут. Разница в 30 раз. Для производительности выбираем JSON, где возможно.

Как работает парсер Wildberries?

Используем асинхронный httpx для обхода пагинации. Пример:

# scraper/reviews/wildberries.py import httpx import asyncio from dataclasses import dataclass from typing import Optional @dataclass class Review: external_id: str product_nm_id: int author: str rating: int text: str pros: Optional[str] cons: Optional[str] date: str photos: list[str] helpful_count: int class WildberriesReviewScraper: REVIEWS_URL = "https://feedbacks2.wb.ru/feedbacks/v2/{nm_id}" def __init__(self): self.client = httpx.AsyncClient( headers={ "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64)", "Origin": "https://www.wildberries.ru", "Referer": "https://www.wildberries.ru/", } ) async def get_reviews(self, nm_id: int, take: int = 100) -> list[Review]: all_reviews = [] skip = 0 while True: url = self.REVIEWS_URL.format(nm_id=nm_id) params = { "immt": nm_id, "skip": skip, "take": take, "order": "dateDesc", } resp = await self.client.get(url, params=params) resp.raise_for_status() data = resp.json() feedbacks = data.get("feedbacks", []) if not feedbacks: break for fb in feedbacks: all_reviews.append(self._normalize(nm_id, fb)) skip += take await asyncio.sleep(1.0) # Ограничение: не более 1000 отзывов за сессию if skip >= 1000: break return all_reviews def _normalize(self, nm_id: int, raw: dict) -> Review: photos = [] for photo in raw.get("photos", []): if full_url := photo.get("fullSize"): photos.append(full_url) return Review( external_id=raw.get("id", ""), product_nm_id=nm_id, author=raw.get("wbUserDetails", {}).get("name", "Покупатель"), rating=raw.get("productValuation", 0), text=raw.get("text", ""), pros=raw.get("pros"), cons=raw.get("cons"), date=raw.get("createdDate", ""), photos=photos, helpful_count=raw.get("feedbackValuation", 0), ) 

Парсинг HTML-отзывов

Для сайтов без API используем парсинг HTML через PHP и Symfony Crawler. Пример для iHerb:

// app/Services/ReviewScraper/HtmlReviewScraper.php class HtmlReviewScraper { public function scrapeIherb(string $productUrl, int $pages = 5): array { $reviews = []; for ($page = 1; $page <= $pages; $page++) { $html = $this->fetch("{$productUrl}?p={$page}&is=1&s=6"); $crawler = new Crawler($html); $items = $crawler->filter('[itemprop="review"]'); if (!$items->count()) break; $items->each(function (Crawler $node) use (&$reviews) { $reviews[] = [ 'external_id' => $node->attr('data-review-id'), 'author' => trim($node->filter('[itemprop="author"]')->text('')), 'rating' => (int) $node->filter('[itemprop="ratingValue"]')->attr('content'), 'date' => $node->filter('[itemprop="datePublished"]')->attr('content'), 'title' => trim($node->filter('[itemprop="name"]')->text('')), 'text' => trim($node->filter('[itemprop="reviewBody"]')->text('')), 'helpful' => (int) $node->filter('.helpful-yes')->text('0'), 'verified' => $node->filter('.verified-buyer')->count() > 0, ]; }); sleep(rand(2, 4)); } return $reviews; } } 

Дедупликация и импорт в Laravel

После сбора отзывы проходят через Job с дедупликацией по external_id и source. Пример:

// app/Jobs/ImportProductReviews.php class ImportProductReviews implements ShouldQueue { public int $tries = 3; public int $backoff = 120; public function handle(ReviewImportService $service): void { $mapping = ProductReviewMapping::where('product_id', $this->productId) ->where('source', $this->source) ->firstOrFail(); $reviews = $this->scrape($mapping->external_id); $imported = 0; $skipped = 0; foreach ($reviews as $reviewData) { $exists = ProductReview::where([ 'source' => $this->source, 'external_id' => $reviewData['external_id'], ])->exists(); if ($exists) { $skipped++; continue; } $service->import($this->productId, $this->source, $reviewData); $imported++; } Log::info("Reviews imported", [ 'product_id' => $this->productId, 'source' => $this->source, 'imported' => $imported, 'skipped' => $skipped, ]); } } 

Фильтрация и модерация

Стоп-слова (спам, реклама, ненормативная лексика), слишком короткие отзывы (<20 символов) и анонимизация авторов — всё настраивается. Ниже пример сервиса:

// app/Services/ReviewImportService.php class ReviewImportService { private array $stopWords = ['купите', 'скидка', 'промокод', 'vk.com', 't.me']; public function import(int $productId, string $source, array $data): ?ProductReview { if (mb_strlen($data['text']) < 20) return null; foreach ($this->stopWords as $word) { if (mb_stripos($data['text'], $word) !== false) return null; } return ProductReview::create([ 'product_id' => $productId, 'source' => $source, 'external_id' => $data['external_id'], 'author' => $this->anonymizeAuthor($data['author']), 'rating' => max(1, min(5, (int) $data['rating'])), 'text' => $this->sanitize($data['text']), 'pros' => $this->sanitize($data['pros'] ?? ''), 'cons' => $this->sanitize($data['cons'] ?? ''), 'date' => $data['date'], 'is_verified' => $data['verified'] ?? false, 'helpful' => $data['helpful'] ?? 0, 'status' => 'pending', ]); } private function anonymizeAuthor(string $name): string { $parts = explode(' ', trim($name)); if (count($parts) >= 2) { return $parts[0] . ' ' . mb_substr($parts[1], 0, 1) . '.'; } return $name ?: 'Покупатель'; } private function sanitize(string $text): string { return strip_tags(trim($text)); } } 

Structured data для SEO

После импорта отзывы публикуются в JSON-LD на странице товара. Это повышает шанс попасть в rich snippets и увеличивает CTR на 20-30%. Подробнее о structured data.

// app/Http/Controllers/ProductController.php public function show(string $slug): Response { $product = Product::withReviews()->findBySlug($slug); $reviewSchema = $product->reviews->map(fn($r) => [ '@type' => 'Review', 'author' => ['@type' => 'Person', 'name' => $r->author], 'datePublished' => $r->date, 'reviewBody' => $r->text, 'reviewRating' => [ '@type' => 'Rating', 'ratingValue' => $r->rating, 'bestRating' => 5, ], ]); $aggregateRating = [ '@type' => 'AggregateRating', 'ratingValue' => round($product->reviews->avg('rating'), 1), 'reviewCount' => $product->reviews->count(), ]; } 

Как избежать блокировок при парсинге?

Для обхода блокировок используем пул из 50+ резидентных прокси, рандомные задержки от 1 до 4 секунд, ротацию User-Agent (Chrome, Firefox, Safari). Капчу решаем через Anti-Captcha. Каждая сессия ограничена 1000 отзывов.

Почему автоматизация отзывов повышает SEO?

  • Structured data (JSON-LD) помогает поисковикам показывать рейтинг в сниппете.
  • UGC-тексты содержат длинные хвосты ключевых слов.
  • Регулярное обновление сигнализирует о живом магазине.

Сравнение: ручной сбор 100 отзывов занимает 2 часа, наш парсер — 2 минуты, в 60 раз быстрее. Экономия бюджета на копирайтеров и модераторов — до 70%.

Процесс работы

  1. Анализ: определяем площадки, API, сложность.
  2. Разработка: пишем парсер, модерацию, дедупликацию.
  3. Тестирование: прогон на 1000+ отзывов, проверка багов.
  4. Деплой: настройка cron, мониторинг ошибок.
  5. Документация: описание стека, инструкция по запуску.
Этап Длительность
Анализ требований 1-2 дня
Разработка парсера 2-3 дня на площадку
Тестирование 1-2 дня
Деплой и документация 1 день

Что входит в работу

  • Парсер для каждой площадки (до 5 площадок).
  • Модерация (стоп-слова, длина, анонимизация).
  • Дедупликация (по external_id + source).
  • Автоматическое обновление по расписанию (ежедневно или раз в 4 часа).
  • Structured data на странице товара.
  • Логирование и уведомления об ошибках.

Сроки: от 3 до 5 рабочих дней на одну площадку. Для комплексного проекта (3 площадки + модерация + SEO) — 7-10 дней. Свяжитесь с нами для оценки вашего проекта. Получите консультацию по вашему проекту.