Краулинговый бюджет: что это и как его экономить
У поискового робота не безграничное время на ваш сайт: за один заход он обходит ограниченное число страниц. Это и есть краулинговый бюджет. Если робот тратит его на мусорные и дублирующие URL, важные страницы индексируются медленно или не попадают в поиск вовсе. Разберём, как не разбазаривать бюджет. Бюджет часто съедают малоценные страницы — про них отдельная статья тонкий контент.
Что такое краулинговый бюджет
Краулинговый бюджет (crawl budget) — это количество страниц сайта, которое поисковый робот готов обойти за определённый период. Он зависит от авторитета сайта, скорости сервера и того, как часто обновляется контент. Робот не обходит весь сайт за раз: он выбирает, что скачать сейчас, а что отложить. Ваша задача — направить его на ценные страницы и не дать тратить заходы на бесполезные.
Кому это важно
Для маленького сайта (до нескольких сотен страниц) бюджет обычно не проблема — робот успевает обойти всё. Краулинговый бюджет критичен для больших сайтов: интернет-магазинов с тысячами карточек и фильтров, маркетплейсов, крупных каталогов и СМИ. Там мусорные URL легко съедают весь обход, и новые товары/статьи неделями ждут индексации.
На что робот тратит бюджет впустую
Как экономить краулинговый бюджет
- Закройте мусор в robots.txt. Страницы поиска, корзину, фильтры с параметрами, технические разделы — Disallow, чтобы робот туда не ходил.
- Уберите дубли. Для сортировок, UTM и пагинации используйте rel=canonical на основную версию; склейте www/без-www и http/https.
- Сократите редиректы. Никаких цепочек: сразу A→финал, один шаг 301.
- Почините 404 и битые ссылки. Робот не должен ходить по ссылкам в никуда.
- Дайте свежий sitemap.xml. С актуальными URL и lastmod — робот идёт по карте целенаправленно.
- Ускорьте сайт. Быстрый ответ сервера = больше страниц за заход.
- Сообщайте об изменениях через IndexNow. Новые и обновлённые страницы уходят на переобход сразу, не дожидаясь планового визита.
Как узнать, как робот тратит бюджет
Прежде чем экономить, посмотрите, на что бюджет уходит сейчас. Главный источник — статистика обхода. В Яндекс.Вебмастере это раздел «Индексирование → Статистика обхода»: видно, сколько страниц робот скачал, какие коды ответа получил, сколько времени отвечал сервер. В Google Search Console аналог — «Настройки → Статистика сканирования». Самый детальный взгляд дают логи сервера: в них записан каждый визит робота, и по ним видно, не ходит ли он толпами по фильтрам, редиректам и 404 вместо товаров и статей. Если в статистике много обращений к мусорным URL и кодов 404 или 301 — вот они, утечки бюджета, которые надо заткнуть.
Из чего складывается бюджет
Краулинговый бюджет — это не одна цифра, а баланс двух вещей. Первая — сколько робот физически может обойти, не перегружая сервер (crawl rate, «скорость обхода»): чем быстрее и стабильнее отвечает сайт, тем больше страниц робот возьмёт за заход. Если сервер тормозит или отдаёт ошибки, робот сбавляет темп, чтобы не уронить сайт. Вторая — насколько роботу вообще интересно обходить сайт (crawl demand, «спрос на обход»): он зависит от авторитета сайта, частоты обновлений и важности страниц. Свежий, авторитетный, часто обновляемый сайт робот посещает охотнее. Вывод практичный: ускоряя сервер, вы поднимаете первое, а регулярно обновляя контент и наращивая траст — второе.
Большие сайты: фильтры и пагинация
На крупных сайтах главные пожиратели бюджета — фасетные фильтры и пагинация, и с ними нужно разбираться прицельно. Фильтры каталога порождают комбинаторный взрыв адресов: «цвет + размер + бренд + цена» дают тысячи URL почти с одним содержимым. Часть из них полезна для SEO (например, «кроссовки Nike» — реальный спрос), а большинство — мусор. Полезные оставляют в индексе, бесполезные закрывают через robots.txt, canonical или Clean-param. Пагинация (страницы 2, 3, 4 каталога) тоже ест бюджет: проследите, чтобы у неё были корректные мета и она не плодила дубли. На большом сайте грамотное управление фильтрами и пагинацией экономит больше бюджета, чем все остальные приёмы вместе. Подробнее — в статьях про фасетную навигацию и пагинацию.
Заблуждение: noindex не экономит бюджет
Тут важно не перепутать инструменты. Многие думают: «закрою ненужные страницы тегом noindex — и робот перестанет тратить на них бюджет». Это не так. Чтобы увидеть noindex, робот должен сначала зайти на страницу и скачать её — то есть бюджет он уже потратил. noindex убирает страницу из индекса, но не из обхода. Если цель именно сэкономить обход, нужен robots.txt с Disallow: тогда робот вообще не пойдёт на эти адреса. Разница принципиальная: Disallow экономит бюджет (не пускает робота), noindex управляет индексом (пускает, но не показывает). Для технического мусора, который незачем обходить, — Disallow; для страниц, которые должны быть доступны людям, но не нужны в поиске, — noindex.
Чек-лист
- Мусорные URL (поиск, корзина, фильтры, UTM) закрыты в robots.txt
- Дубли склеены через canonical, www и http редиректятся 301
- Цепочки редиректов сокращены до одного шага
- 404 и битые ссылки устранены
- Актуальный sitemap.xml отправлен в Вебмастер/Search Console
- Сервер отвечает быстро (до ~1 сек)
- Изменения уходят на переобход через IndexNow
Коротко
Краулинговый бюджет — это сколько страниц робот обойдёт за заход. Для больших сайтов его легко растратить на дубли, параметры, редиректы, 404 и бесполезные страницы. Экономьте его: закрывайте мусор в robots.txt, склеивайте дубли через canonical, сокращайте редиректы, чините 404, давайте свежий sitemap, ускоряйте сервер и пушите изменения через IndexNow. Тогда робот тратит обход на ценные страницы, и они быстрее попадают в поиск.