Главная Статьи Оптимизация

Краулинговый бюджет: что это и как его экономить

У поискового робота не безграничное время на ваш сайт: за один заход он обходит ограниченное число страниц. Это и есть краулинговый бюджет. Если робот тратит его на мусорные и дублирующие URL, важные страницы индексируются медленно или не попадают в поиск вовсе. Разберём, как не разбазаривать бюджет. Бюджет часто съедают малоценные страницы — про них отдельная статья тонкий контент.

Что такое краулинговый бюджет

Краулинговый бюджет (crawl budget) — это количество страниц сайта, которое поисковый робот готов обойти за определённый период. Он зависит от авторитета сайта, скорости сервера и того, как часто обновляется контент. Робот не обходит весь сайт за раз: он выбирает, что скачать сейчас, а что отложить. Ваша задача — направить его на ценные страницы и не дать тратить заходы на бесполезные.

Кому это важно

Для маленького сайта (до нескольких сотен страниц) бюджет обычно не проблема — робот успевает обойти всё. Краулинговый бюджет критичен для больших сайтов: интернет-магазинов с тысячами карточек и фильтров, маркетплейсов, крупных каталогов и СМИ. Там мусорные URL легко съедают весь обход, и новые товары/статьи неделями ждут индексации.

Куда уходит обход робота Без оптимизации мусор: дубли, 404, редиректы — 70% полезное 30% После оптимизации полезные страницы — 85% мусор 15%
Закрыв мусор, вы перенаправляете обход робота на товары и статьи, которые должны быть в индексе.

На что робот тратит бюджет впустую

🔁
Дубли и параметры
URL с UTM, сортировками, фильтрами — тысячи почти одинаковых страниц.
↪️
Цепочки редиректов
Каждый лишний переход 301/302 — потраченный запрос робота.
🚫
Битые ссылки и 404
Робот ходит по ссылкам на несуществующие страницы.
🕳
Бесполезные страницы
Пустые теги, архивы, страницы поиска, корзина, технические URL.
🐌
Медленный сервер
Чем дольше отвечает сайт, тем меньше страниц робот успеет за заход.
🗺
Нет карты сайта
Без sitemap робот ищет страницы только по ссылкам и может их пропустить.

Как экономить краулинговый бюджет

  1. Закройте мусор в robots.txt. Страницы поиска, корзину, фильтры с параметрами, технические разделы — Disallow, чтобы робот туда не ходил.
  2. Уберите дубли. Для сортировок, UTM и пагинации используйте rel=canonical на основную версию; склейте www/без-www и http/https.
  3. Сократите редиректы. Никаких цепочек: сразу A→финал, один шаг 301.
  4. Почините 404 и битые ссылки. Робот не должен ходить по ссылкам в никуда.
  5. Дайте свежий sitemap.xml. С актуальными URL и lastmod — робот идёт по карте целенаправленно.
  6. Ускорьте сайт. Быстрый ответ сервера = больше страниц за заход.
  7. Сообщайте об изменениях через IndexNow. Новые и обновлённые страницы уходят на переобход сразу, не дожидаясь планового визита.
🛠
Закройте лишнее генератором robots.txt, соберите карту генератором sitemap.xml, найдите битые ссылки в проверке битых ссылок и лишние переходы в проверке редиректов. Сколько страниц в индексе — массовая проверка индексации.

Как узнать, как робот тратит бюджет

Прежде чем экономить, посмотрите, на что бюджет уходит сейчас. Главный источник — статистика обхода. В Яндекс.Вебмастере это раздел «Индексирование → Статистика обхода»: видно, сколько страниц робот скачал, какие коды ответа получил, сколько времени отвечал сервер. В Google Search Console аналог — «Настройки → Статистика сканирования». Самый детальный взгляд дают логи сервера: в них записан каждый визит робота, и по ним видно, не ходит ли он толпами по фильтрам, редиректам и 404 вместо товаров и статей. Если в статистике много обращений к мусорным URL и кодов 404 или 301 — вот они, утечки бюджета, которые надо заткнуть.

Из чего складывается бюджет

Краулинговый бюджет — это не одна цифра, а баланс двух вещей. Первая — сколько робот физически может обойти, не перегружая сервер (crawl rate, «скорость обхода»): чем быстрее и стабильнее отвечает сайт, тем больше страниц робот возьмёт за заход. Если сервер тормозит или отдаёт ошибки, робот сбавляет темп, чтобы не уронить сайт. Вторая — насколько роботу вообще интересно обходить сайт (crawl demand, «спрос на обход»): он зависит от авторитета сайта, частоты обновлений и важности страниц. Свежий, авторитетный, часто обновляемый сайт робот посещает охотнее. Вывод практичный: ускоряя сервер, вы поднимаете первое, а регулярно обновляя контент и наращивая траст — второе.

Большие сайты: фильтры и пагинация

На крупных сайтах главные пожиратели бюджета — фасетные фильтры и пагинация, и с ними нужно разбираться прицельно. Фильтры каталога порождают комбинаторный взрыв адресов: «цвет + размер + бренд + цена» дают тысячи URL почти с одним содержимым. Часть из них полезна для SEO (например, «кроссовки Nike» — реальный спрос), а большинство — мусор. Полезные оставляют в индексе, бесполезные закрывают через robots.txt, canonical или Clean-param. Пагинация (страницы 2, 3, 4 каталога) тоже ест бюджет: проследите, чтобы у неё были корректные мета и она не плодила дубли. На большом сайте грамотное управление фильтрами и пагинацией экономит больше бюджета, чем все остальные приёмы вместе. Подробнее — в статьях про фасетную навигацию и пагинацию.

Заблуждение: noindex не экономит бюджет

Тут важно не перепутать инструменты. Многие думают: «закрою ненужные страницы тегом noindex — и робот перестанет тратить на них бюджет». Это не так. Чтобы увидеть noindex, робот должен сначала зайти на страницу и скачать её — то есть бюджет он уже потратил. noindex убирает страницу из индекса, но не из обхода. Если цель именно сэкономить обход, нужен robots.txt с Disallow: тогда робот вообще не пойдёт на эти адреса. Разница принципиальная: Disallow экономит бюджет (не пускает робота), noindex управляет индексом (пускает, но не показывает). Для технического мусора, который незачем обходить, — Disallow; для страниц, которые должны быть доступны людям, но не нужны в поиске, — noindex.

Чек-лист

📚
Глубже по теме: IndexNow и ускорение индексации, canonical и дубли, редиректы 301/302, индексация сайта. Увидеть, как робот реально тратит бюджет, помогает анализ логов сервера.

Коротко

Краулинговый бюджет — это сколько страниц робот обойдёт за заход. Для больших сайтов его легко растратить на дубли, параметры, редиректы, 404 и бесполезные страницы. Экономьте его: закрывайте мусор в robots.txt, склеивайте дубли через canonical, сокращайте редиректы, чините 404, давайте свежий sitemap, ускоряйте сервер и пушите изменения через IndexNow. Тогда робот тратит обход на ценные страницы, и они быстрее попадают в поиск.

Частые вопросы

Что такое краулинговый бюджет простыми словами?
Это количество страниц сайта, которое поисковый робот готов обойти за определённый период. Робот не скачивает весь сайт сразу, поэтому важно, чтобы он тратил заходы на ценные страницы, а не на мусорные и дублирующие URL.
Кому важен краулинговый бюджет?
Прежде всего большим сайтам — интернет-магазинам с тысячами карточек и фильтров, маркетплейсам, крупным каталогам и СМИ. Для маленьких сайтов (до нескольких сотен страниц) робот обычно успевает обойти всё, и бюджет не проблема.
На что робот тратит бюджет впустую?
На дубли и URL с параметрами (UTM, сортировки, фильтры), цепочки редиректов, битые ссылки и 404, бесполезные страницы (поиск, корзина, пустые теги, архивы). Плюс медленный сервер сокращает число страниц за заход.
Как сэкономить краулинговый бюджет?
Закройте мусор в robots.txt, склейте дубли через canonical, сократите редиректы до одного шага, почините 404 и битые ссылки, дайте свежий sitemap.xml, ускорьте сервер и отправляйте изменения на переобход через IndexNow.
Экономит ли noindex краулинговый бюджет?
Нет. Чтобы увидеть noindex, робот должен сначала зайти на страницу и скачать её — бюджет уже потрачен. noindex убирает страницу из индекса, но не из обхода. Чтобы сэкономить именно обход, нужен Disallow в robots.txt: тогда робот вообще не пойдёт на эти адреса. Disallow экономит бюджет, noindex управляет индексом.
Как посмотреть, как робот обходит сайт?
В Яндекс.Вебмастере — раздел «Индексирование → Статистика обхода», в Google Search Console — «Настройки → Статистика сканирования»: сколько страниц скачано, какие коды ответа, время сервера. Самый детальный взгляд дают логи сервера — по ним видно, не ходит ли робот по фильтрам, редиректам и 404 вместо полезных страниц.
Читайте также: Sitemap для больших сайтов: индекс карт и лимиты