Почему Google индексирует заблокированные веб-страницы


Джон Мюллер из Google объяснил, почему Google индексирует ограниченные страницы, а также почему отчеты Search Console, связанные с этим, можно безопасно пропускать.

Джон Мюллер из Google дал ответ на вопрос о том, почему Google индексирует страницы, которые запрещены для выполнения обхода с помощью файла robots.txt, и почему можно не учитывать соответствующие отчеты Search Console об этих обходах.

Трафик ботов к URL-адресам с параметрами запроса

Человек, задающий вопрос, записал, что боты создают ссылки на несуществующие URL-адреса с параметрами запросов (?q=xyz) на страницы с мета-тегами noindex, которые также блокированы в robots.txt. Вопрос был вызван тем, что Google сканирует эти ссылки на страницы, блокируется в robots.txt (не видя мета-тег noindex), а затем сообщает об этом в Google Search Console как "Индексируется, хотя заблокировано robots.txt."

Человек спросил следующий вопрос:

"Но вот главный вопрос: почему Google индексирует страницы, когда он не может увидеть содержимое? В чем тут выгода?"

Джон Мюллер из Google подтвердил, что если они не могут обойти страницу, они не могут увидеть мета-тег noindex. Он также заметил оператор site:search, посоветовав пропускать результаты, потому что "средние" пользователи не замечают их.

Он написал:

"Да, вы правы: если мы не можем проникнуть на страницу, мы не можем заметить noindex. Тем не менее, если мы не можем рикжаться страницы, для нас там мало что можно индексировать. Так что, хотя вы можете наблюдать некоторые из этих страниц с помощью целевого запроса site:, средний пользователь их не заметит, поэтому я бы не переживал. Noindex также работает (без запрета в robots.txt), это просто означает, что URL-адреса будут обходиться (и попадут в отчет Search Console как 'обойдены/не индексируются' — ни один из этих статусов не приводит к проблем для остальной части сайта). Важно, чтобы вы не делали их доступными для обхода и индексации."

Связанный: Google советует сайтам использовать файл robots.txt для блокировки URL-адресов действий.

Выводы:

1. Ответ Мюллера подтверждает ограничения использования оператора Site:search для диагностических целей. Одной из причин является то, что он не связан с обычным поисковым индексом, это совсем отдельная штука.

Джон Мюллер из Google прокомментировал оператор site search в 2021 году:

"Короткий ответ заключается в том, что запрос site: не предназначен для всестороннего охвата, а также для диагностических целей.

Запрос site: — это определенный вид поиска, который ограничивает результаты определенным веб-сайтом. Это, по сути, просто слово "site", двоеточие и затем домен веб-сайта.

Этот запрос уменьшает результаты конкретным веб-сайтом. Он не предназначен для того, чтобы быть исчерпывающей подборкой всех страниц этого сайта."

Оператор site не отражает индекс поиска Google, что превращает его ненадежным для осмысления того, какие страницы Google уже учел или нет. Как и другие операторы расширенного поиска Google, они ненадежны как инструменты для понимания любых вопросов, связанных с тем, как Google ранжирует или индексирует контент.

2. Мета-тег noindex без применения robots.txt подходит для таких ситуаций, когда бот разрабатывает ссылки на несуществующие страницы, которые выявляются Googlebot.

Мета-тег noindex на страницах, которые не блокируются в robots.txt, разрешает Google просканировать страницу и прочитать директиву noindex, гарантируя, что страница не проявится в поисковом индексе, что удобно, если цель состоит в том, чтобы не разрешить страницу в поисковый индекс Google.

3. URL-адреса с мета-тегом noindex создадут в Search Console запись "обойдены/не индексируются", что не окажет негативного результата на остальную часть веб-сайта.

Эти записи в Search Console, в контексте страниц, которые намеренно заблокированы, лишь указывают на то, что Google просмотрел страницу, но не проиндексировал. По сути говоря, что это имело место, а не то, что (в этом данном контексте) есть что-то, что нужно поправить. Эта запись полезна для предупреждения издателей о страницах, которые случайно заблокированы мета-тегом noindex или по какой-либо другой причине, мешающей индексации страницы. Тогда это стоит расследовать.

1 2 3 4 5 6 7 8 9 10 11 12 13 14 15

Comments on “Почему Google индексирует заблокированные веб-страницы”

Leave a Reply

Gravatar