Справочник по поисковой оптимизации для тех, кто начинает [email protected]

Зачем SEO-специалисту настольный краулер и что он находит на сайте

Опубликовано · рубрика Блог

Screaming Frog: зачем нужна программа и что она показывает
Screaming Frog: зачем нужна программа и что она показывает

Screaming Frog SEO Spider — настольная программа, которая обходит сайт по внутренним ссылкам примерно так же, как это делает поисковый робот, и складывает всё увиденное в таблицу. Это базовый инструмент технического аудита: то, что вручную проверяется днями, он показывает за несколько минут.

Что именно она делает

Программа запускается на компьютере, получает стартовый адрес и начинает обход: скачивает страницу, разбирает html, достаёт ссылки, идёт по ним дальше. Для каждого адреса сохраняются код ответа, title, description, заголовки, канонический адрес, размер, время ответа, глубина вложенности, входящие и исходящие ссылки.

Результат — таблица, которую можно сортировать и фильтровать. Именно в этом ценность: проблемы становятся видны как группы строк, а не как отдельные случайные находки.

Какие проблемы находятся сразу

  • Битые ссылки и страницы с кодом 404, на которые ссылается сам сайт.
  • Цепочки редиректов, где один адрес ведёт на второй, тот на третий, и робот теряет часть сигналов.
  • Дубли title и description — верный признак шаблонной генерации страниц.
  • Пустые или отсутствующие заголовки первого уровня.
  • Слишком глубокая вложенность: страницы, до которых от главной больше четырёх кликов.
  • Изображения без атрибута alt и картинки, весящие мегабайты.
  • Некорректные канонические адреса, в том числе ссылающиеся на закрытые от индексации страницы.

Как настроить первый обход

  • Ограничьте скорость — по умолчанию программа отправляет пять запросов в секунду, и слабый хостинг это заметит. Одного-двух хватит.
  • Задайте глубину и лимит адресов — иначе на каталоге с фильтрами обход уйдёт в бесконечность.
  • Решите, учитывать ли robots.txt — режим с соблюдением правил показывает картину глазами робота, режим без них — реальную структуру сайта.
  • Включите отрисовку JavaScript, если сайт собирается в браузере: без этого краулер увидит пустые страницы.
  • Проверьте на копии, если сайт нагружен. Обход боевого сервера в час пик — плохая идея.

Ограничения

Бесплатная версия обходит ограниченное число адресов — этого хватает для небольших сайтов и для выборочной проверки крупных. Программа работает локально, поэтому крупный обход требует памяти: на сотнях тысяч адресов без перевода базы на диск не обойтись.

И главное ограничение: краулер показывает данные, но не расставляет приоритеты. Список из тысячи «ошибок» после первого обхода обычно состоит на девяносто процентов из мелочей. Понимание, что из этого важно, приходит не от программы, а от знания того, как работает поиск.

Что делать с выгрузкой

Полезная привычка — сохранять выгрузку каждого обхода с датой. Тогда после релиза видно, что изменилось: появились ли новые ошибки, выросло ли количество страниц, не поехали ли канонические адреса. Сравнение двух выгрузок находит проблемы быстрее, чем чтение одной.

Второй приём — соединять данные краулера с данными аналитики и панели вебмастера. Страница с ошибкой, на которую никто не заходит и которая не в индексе, и страница с той же ошибкой, приносящая половину трафика, требуют разного отношения.

Альтернативы

Задачу закрывают и другие настольные краулеры, и облачные сервисы с обходом по расписанию. Выбор чаще определяется бюджетом и объёмом сайта, чем набором функций: базовый отчёт у всех похожий, различия начинаются в интеграциях и лимитах.