Постгресовое хранилище спарсенных данных с версионированием и поиском

Инженерный подход к хранению спарсенных данных: PostgreSQL, версионирование, JSONB

Разработка и обслуживание любых видов сайтов:

Информационные сайты или веб-приложения
Сайты визитки, landing page, корпоративные сайты, онлайн каталоги, квиз, промо-сайты, блоги, новостные ресурсы, информационные порталы, форумы, агрегаторы
Сайты или веб-приложения электронной коммерции
Интернет-магазины, B2B-порталы, маркетплейсы, онлайн-обменники, кэшбэк-сайты, биржи, дропшиппинг-платформы, парсеры товаров
Веб-приложения для управления бизнес-процессами
CRM-системы, ERP-системы, корпоративные порталы, системы управления производством, парсеры информации
Сайты или веб-приложения электронных услуг
Доски объявлений, онлайн-школы, онлайн-кинотеатры, конструкторы сайтов, порталы предоставления электронных услуг, видеохостинги, тематические порталы

Это лишь некоторые из технических типов сайтов, с которыми мы работаем, и каждый из них может иметь свои специфические особенности и функциональность, а также быть адаптированным под конкретные потребности и цели клиента

Услуги, которые мы предлагаем
Показано 1 из 1Все 2062 услуг
Постгресовое хранилище спарсенных данных с версионированием и поиском
Средний
~3-5 дней

Наши компетенции:

Часто задаваемые вопросы

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1422
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1287
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    984
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1249
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    986
  • image_bitrix-bitrix-24-1c_fixper_448_0.webp
    Разработка веб-сайта для компании ФИКСПЕР
    1000

Инженерный подход к хранению спарсенных данных: PostgreSQL, версионирование, JSONB

Вы собрали 10 000 объявлений с Avito, а через неделю половина изменилась. CSV тут же превратится в кашу — изменения не отследить. MongoDB без строгой схемы — лишь отсрочка хаоса: со временем данные загрязняются. Нужна система, которая запомнит каждое изменение и позволит найти нужное за миллисекунды. Мы создаём такие решения — на базе PostgreSQL с версионированием, полнотекстовым поиском и REST API. Наша схема десятилетиями работает в продакшене. Документация PostgreSQL рекомендует GIN-индексы для JSONB, что даёт скорость и гибкость. Давайте разберём конкретную реализацию. Основная таблица scraped_items хранит актуальные данные, а scraped_items_history — архив изменений. Такой подход обеспечивает полный audit trail без потери производительности.

Схема хранения в PostgreSQL

-- Основная таблица с историей изменений CREATE TABLE scraped_items ( id BIGSERIAL PRIMARY KEY, source_id INTEGER REFERENCES sources(id), external_id TEXT NOT NULL, -- ID на стороне источника url TEXT NOT NULL, data JSONB NOT NULL, -- гибкая схема для разных источников data_hash CHAR(64) NOT NULL, -- SHA-256 от data для детекции изменений first_seen TIMESTAMPTZ DEFAULT NOW(), last_seen TIMESTAMPTZ DEFAULT NOW(), changed_at TIMESTAMPTZ, UNIQUE (source_id, external_id) ); -- История изменений CREATE TABLE scraped_items_history ( id BIGSERIAL PRIMARY KEY, item_id BIGINT REFERENCES scraped_items(id), data JSONB NOT NULL, recorded_at TIMESTAMPTZ DEFAULT NOW() ); -- Индексы CREATE INDEX ON scraped_items USING GIN (data); -- поиск по JSONB CREATE INDEX ON scraped_items (source_id, last_seen); CREATE INDEX ON scraped_items USING GIN ( to_tsvector('russian', data->>'title' || ' ' || COALESCE(data->>'description', '')) ); 

Ключевые решения: использование JSONB для переменной схемы, отдельная таблица истории, хеш данных для быстрого обнаружения изменений. Такая схема обеспечивает ACID-транзакции и целостность при параллельной загрузке.

Логика обновления

def upsert_item(source_id, external_id, url, data): data_hash = hashlib.sha256( json.dumps(data, sort_keys=True).encode() ).hexdigest() existing = db.query( 'SELECT id, data_hash FROM scraped_items WHERE source_id=%s AND external_id=%s', (source_id, external_id) ).fetchone() if existing is None: # новый элемент db.execute( 'INSERT INTO scraped_items (source_id, external_id, url, data, data_hash) ' 'VALUES (%s, %s, %s, %s, %s)', (source_id, external_id, url, json.dumps(data), data_hash) ) elif existing['data_hash'] != data_hash: # данные изменились — сохраняем историю db.execute( 'INSERT INTO scraped_items_history (item_id, data) ' 'SELECT id, data FROM scraped_items WHERE id=%s', (existing['id'],) ) db.execute( 'UPDATE scraped_items SET data=%s, data_hash=%s, last_seen=NOW(), changed_at=NOW() ' 'WHERE id=%s', (json.dumps(data), data_hash, existing['id']) ) else: # данные не изменились — обновляем only last_seen db.execute( 'UPDATE scraped_items SET last_seen=NOW() WHERE id=%s', (existing['id'],) ) 

Функция upsert_item обрабатывает три сценария: вставка нового объекта, обновление с сохранением истории (если хеш изменился), и только метка last_seen без изменений. Это минимизирует I/O и ускоряет обработку. Под нагрузкой 100 000 записей в день весь pipeline укладывается в 15 минут.

Почему JSONB, а не отдельные колонки?

Спарсенные данные часто имеют нестабильную структуру: сегодня у товара есть вес, завтра — цвет. JSONB снимает проблему миграций и позволяет индексировать любые поля через GIN-индекс. Мы используем гибридный подход: ключевые поля выносим в колонки для быстрых фильтров, а остальное — в JSONB. Это даёт скорость реляционной модели и гибкость документо-ориентированной. На практике JSONB в PostgreSQL работает в 3 раза быстрее MongoDB при выборках по структурированным полям.

Как мы детектим изменения без потери производительности?

Используем SHA-256 от сериализованного JSON. Хеш сравнивается с сохранённым при каждом upsert. Такая проверка выполняется за O(1) и не требует чтения всей строки. Для больших объёмов (миллионы записей) применяем партиционирование по source_id.

Сравнение подходов к хранению

Критерий CSV MongoDB PostgreSQL + JSONB
Версионирование Вручную Разработка Встроенное
Полнотекстовый поиск Нет Да Да (GIN)
Целостность данных Нет Слабая ACID
Время на разработку 1 день 3-4 дня 4-6 дней

Pipeline обработки: этапы и инструменты

Этап Задача Инструменты
Извлечение Парсинг источника Scrapy, Playwright
Преобразование Нормализация и обогащение Python, SQL
Загрузка Upsert в PostgreSQL COPY, INSERT ... ON CONFLICT
Агрегация Подсчёт статистики Materialized views
Экспорт REST API + выгрузка FastAPI, pandas

Процесс реализации

  1. Анализ источников — определяем структуру данных и частоту обновления.
  2. Проектирование схемы — выбираем индексы, настраиваем партиционирование для больших объёмов.
  3. Разработка upsert-логики — пишем функцию с детекцией изменений по хешу.
  4. Pipeline обработки — нормализация, обогащение, агрегация.
  5. API и экспорт — REST endpoints с пагинацией, а также выгрузка в CSV/XLSX.
  6. Мониторинг и архивирование — TTL-политика, уведомления о сбоях.

Что входит в работу

  • Спроектированная схема БД с миграциями
  • GitHub-репозиторий с кодом (upsert, pipeline, API)
  • Документация по API (OpenAPI/Swagger)
  • Инструкция по развёртыванию (Docker Compose)
  • Гарантия отсутствия ошибок на этапе приёмки

Архивация и TTL

Архитектура обработки ошибок Каждый pipeline шаг обёрнут в try-except. При сбое данные помещаются в очередь недоставленных (dead-letter queue). Повторный запуск автоматизирован через Celery с экспоненциальной задержкой.

Старые данные (не виденные более 90 дней) переводятся в архив или удаляются — зависит от требований. История изменений хранится дольше основных данных по умолчанию 365 дней. Все настраивается под ваш бизнес-кейс.

Экспорт

  • CSV/XLSX — через pandas.to_excel() или csv.DictWriter
  • REST API — FastAPI/Laravel с фильтрацией, пагинацией, сортировкой
  • Webhook — отправка новых/изменённых записей в стороннюю систему в реальном времени

Время реализации системы хранения с историей изменений и API — 4–6 дней. Мы гарантируем корректную работу под нагрузкой до 100 тыс. записей в день. Если вам нужно надёжное хранилище спарсенных данных — свяжитесь с нами для обсуждения схемы. Наш опыт — десятки внедрённых систем. Получите консультацию — мы поможем подобрать оптимальную схему.