Оптимизация краулингового бюджета (Crawl Budget) сайта

Оптимизация краулингового бюджета (Crawl Budget) сайта

Разработка и обслуживание любых видов сайтов:

Информационные сайты или веб-приложения
Сайты визитки, landing page, корпоративные сайты, онлайн каталоги, квиз, промо-сайты, блоги, новостные ресурсы, информационные порталы, форумы, агрегаторы
Сайты или веб-приложения электронной коммерции
Интернет-магазины, B2B-порталы, маркетплейсы, онлайн-обменники, кэшбэк-сайты, биржи, дропшиппинг-платформы, парсеры товаров
Веб-приложения для управления бизнес-процессами
CRM-системы, ERP-системы, корпоративные порталы, системы управления производством, парсеры информации
Сайты или веб-приложения электронных услуг
Доски объявлений, онлайн-школы, онлайн-кинотеатры, конструкторы сайтов, порталы предоставления электронных услуг, видеохостинги, тематические порталы

Это лишь некоторые из технических типов сайтов, с которыми мы работаем, и каждый из них может иметь свои специфические особенности и функциональность, а также быть адаптированным под конкретные потребности и цели клиента

Услуги, которые мы предлагаем
Показано 1 из 1Все 2062 услуг
Оптимизация краулингового бюджета (Crawl Budget) сайта
Средний
~2-3 дня

Наши компетенции:

Часто задаваемые вопросы

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1418
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1286
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    983
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1243
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    983
  • image_bitrix-bitrix-24-1c_fixper_448_0.webp
    Разработка веб-сайта для компании ФИКСПЕР
    998

Оптимизация краулингового бюджета (Crawl Budget) сайта

Новые страницы не индексируются неделями, а Googlebot застревает в фильтрах каталога — типичная проблема интернет-магазинов. Crawl Budget — лимит URL, который поисковик готов обработать за сутки. Если бюджет тратится на мусор (параметры сессий, дубли, служебные страницы), важный контент остается незамеченным. Оптимизация бюджета способна увеличить количество проиндексированных страниц на 40–60% всего за 2–3 дня — это подтверждают наши проекты. Например, интернет-магазин с 50 000 товаров терял 70% краулингового бюджета на страницы фильтров. После блокировки параметров и настройки canonical индексация новых товаров ускорилась с 14 дней до 2 дней — рост проиндексированных страниц на 45%.

Почему Googlebot не индексирует важные страницы?

Перегрузка краулингового бюджета бесполезными URL — главная причина. Типичный интернет-магазин теряет до 70% бюджета на страницы с параметрами сортировки, фильтрации и UTM-метками. В результате товары-новинки не попадают в индекс, а старые дубли занимают место. Анализ логов 50 сайтов показал: в среднем 80% запросов Googlebot приходятся на URL, которые не приносят трафика. По данным Google, эффективное использование краулингового бюджета — один из ключевых факторов быстрой индексации нового контента. Подробнее о концепции можно узнать в документации Google.

Как освободить краулинговый бюджет за один день?

Вручную анализировать логи — день работы, но автоматизированный скрипт справляется за 10 минут. Анализ текущего бюджета — первый шаг. Используем Google Search Console (Crawl Stats) и лог-анализатор вроде Screaming Frog. Команда для извлечения краулеров из access.log:

grep "Googlebot" /var/log/nginx/access.log | \ awk '{print $7}' | sort | uniq -c | sort -rn | head -50 | \ grep "?" | sed 's/=.*/=X/g' | sort | uniq -c | sort -rn | head -30 

Этот скрипт показывает, какие URL с параметрами краулит бот. На основе отчета мы определяем, что блокировать. С его помощью мы экономим до 10 часов ручного анализа.

robots.txt: первая линия обороны

Запрещаем незначимые разделы:

User-agent: * Disallow: /search? Disallow: /cart/ Disallow: /checkout/ Disallow: /account/ Disallow: /admin/ Disallow: /*?session_id= Disallow: /*?utm_source= Disallow: /*?utm_medium= Disallow: /*?ref= Disallow: /wp-json/ Disallow: /wp-admin/ Disallow: /*.pdf$ Allow: /sitemap.xml Allow: /robots.txt 

Важно не переборщить — случайно не заблокировать важные страницы. Мы проверяем coverage после каждого изменения.

Canonical для дублирующегося контента

Дубли с параметрами, trailing slash и http/https — канонические ссылки решают всё:

<!-- /catalog/shoes?color=red&size=42 --> <link rel="canonical" href="https://site.com/catalog/shoes"> 

После расстановки canonical бюджет перестает расходоваться на варианты фильтров. В сочетании с robots.txt экономия бюджета увеличивается в 2 раза по сравнению с использованием каждого метода по отдельности.

Sitemap.xml оптимизация

В sitemap включаем только индексируемые страницы с датой обновления < 2 лет. Пример генерации на Python:

def generate_optimized_sitemap(db): pages = db.query(""" SELECT url, updated_at, priority FROM pages WHERE status = 'published' AND noindex = false AND updated_at > NOW() - INTERVAL '2 years' ORDER BY priority DESC, updated_at DESC """) # ... (полный код в статье) 

Не добавляем страницы с noindex, 404, редиректы.

Сравнение методов блокировки краулинга

Метод Цель Пример Эффективность
robots.txt Запрет краулинга целых разделов Disallow: /cart/ 90% — экономия на мусорных URL
canonical Снятие дублей rel="canonical" 95% — устранение вариантов параметров
noindex Удаление страниц из индекса 100% — страница исключается из поиска

Canonical в сочетании с robots.txt даёт наилучший результат: robots.txt блокирует доступ, а canonical указывает предпочтительную версию снаружи.

Пошаговая инструкция: анализ логов за 10 минут

  1. Скачайте access.log с сервера (за последние 7 дней).
  2. Запустите grep-команду из раздела выше.
  3. Отсортируйте URL по частоте и выявите мусорные паттерны.
  4. Добавьте запреты в robots.txt или настройте canonical.
  5. Повторно проанализируйте логи через неделю — убедитесь в снижении краулинга мусора.

Что входит в работу

Этап Действие Результат
1. Анализ Сбор логов, Screaming Frog, GSC Отчёт о расходовании бюджета
2. Блокировка robots.txt, canonical, параметры в GSC Черновик настроек
3. Оптимизация Генерация sitemap, настройка Crawl-Delay Финальный конфиг
4. Тест Проверка coverage в GSC, повторный анализ Подтверждение улучшений

Мы предоставляем документацию и обучение вашей команды. Гарантируем, что через 2–3 дня вы увидите рост проиндексированных страниц. Свяжитесь с нами для аудита вашего краулингового бюджета — мы проанализируем ситуацию и предложим конкретные шаги.

Сроки

Аудит и оптимизация — от 1 до 2 рабочих дней. Стоимость рассчитывается индивидуально, зависит от объёма сайта. Закажите консультацию — мы подберём оптимальный план.

Типичные ошибки

  • Слишком агрессивный robots.txt: случайно блокируете разделы, которые нужно индексировать
  • Забыли про sitemap: после блокировок важно обновить карту сайта
  • Не учли мобильную версию: если сайт на m.domain.com, правила применяются отдельно

Мы — команда с 5-летним опытом, реализовали более 100 проектов по оптимизации индексации. Не допускайте этих ошибок — получите консультацию по настройке краулингового бюджета и ускорьте индексацию важных страниц.