Spider yandex com что это

от admin

Фейковый бот Яндекса 77-88-47-68.spider.yandex.com ?

Это Яндекс, или кто-то маскируется под него? Стоит ли их забанить?

Это доменное имя резолвится ДНСом Яндекса на заявленный IP адрес:

Т.е. этот IP владельца домена yandex.com

Айпишники принадлежат яндексу. Я б пока банить не стал 🙂

А что за юзер агент?

У Яндекса там лет 8 сети есть. Да и офис.

У меня давно эти айпи в вайтлисте

Ну да, у меня тоже 🙂

И у меня в базе ботов есть, оказывается.

Если установлено значение Crawl-delay: 40 для Яндекса и Меил.ру , но я визуально вижу роботы заходят чаще. Нормально ли их банить скажем на 5 минут, как реализовано в плагине WP Wordfence Security?

DDoS с неожиданного направления или «стоит ли боятся ботов ПС?»

Хочу рассказать интересную историю про взаимодействие с поисковыми роботами, а в частности с ботами великого и могучего Яндекса.

Преамбула. У меня имеется выделенный сервер, на котором крутится порядка нескольких десятков сайтов. Проблем не было никогда, машинка бодрая, новая. Несколько дней назад поступил репорт, что всё «зависло». Пришлось делать удаленную перезагрузку. Позже заметил, что нагрузка на ЦП выросла до 60% с 10% и стала держаться на этом уровне. Я, конечно, насторожился, но мало ли.

И вот вчера всё виснет напрочь. Перезагружаю — прогруз и снова полный штиль. Все сайты уходят вне доступа. После мониторинга процессов увидел загрузку mysql в 99.9%. Удивился, пошел искать сайт, с которого такая загрузка идёт. Нашел, отсеял другие запросы и увидел, что кто-то настойчиво долбит в 40к запросов в секунду, перегружая бедную БД по «самое не могу». Начинаю копать логи и вижу подсети, с которых идут эти запросы. Подключаюсь к серверу, прописываю DROP в iptables по маске /24, и всё нормализуется.

Обратил внимание, что ддосер посылает идентификацию Яндекс-бота. Слегка это удивило, но мало ли. Решил проверить, и оказалось, что две подсети, которые мне пришлось забанить принадлежат как раз-таки паучкам Яндекса.

После досконального изучения зачем и что боты делали на сайте с таким остервенением стало ясно, что боты дорвались до незакрытого фильтра товаров и наплодили по ссылкам невероятную кучу страниц, которые и стали усиленно просматривать с целью индексирования. Почему не сработала у них какая-то отсечка на подобное — не ясно. Сайт с данным фильтром работает более трёх лет и никаких проблем не было.

На данный момент фильтр закрыт от индексации через htaccess, боты разбанены, а я жду ответа от поддержки Яндекса.

И я понимаю, будь я предусмотрительней — подобных проблем не было бы. Но всё же.

Поисковые роботы

Поисковый робот, он же паук (от англ. spider), или краулер (англ. crawler = «ползун») или просто бот — это программа поисковой системы, которая осуществляет сканирование сайтов. Считывание страниц поисковым ботом — первый этап в процессе индексирования сайта поисковой системой.

Что делает робот

Чего не делает робот

Вопреки расхожему мнению, робот непосредственно не занимается какой-либо обработкой сканируемых документов. Он их только считывает и сохраняет, дальше их обработку осуществляют другие программы. Наглядное подтверждение можно получить, анализируя логи сайта, который индексируется в первый раз. При первом визите бот сначала запрашивает файл robots.txt, затем главную страницу сайта. То есть идет по единственной известной ему ссылке. На этом первый визит бота всегда и заканчивается. Через некоторое время (обычно на следующий день) бот запрашивает следующие страницы — по ссылкам, которые найдены на уже считанной странице. Дальше процесс продолжается в том же порядке: запрос страниц, ссылки на которые уже найдены — пауза на обработку считанных документов — следующий сеанс с запросом найденных ссылок.

Разбор страниц «на лету» означал бы значительно большую ресурсоемкость робота и потери времени. Каждый сервер сканирования запускает множество процессов-ботов параллельно. Они должны действовать максимально быстро, чтобы успеть считывать новые страницы и повторно перечитывать уже известные. Поэтому боты только считывают и сохраняют документы. Все, что они сохраняют, ставится в очередь на обработку (разборку кода). Найденные при обработке страниц ссылки ставятся в очередь заданий для ботов. Так и идет непрерывное сканирование всей сети. Единственное, что бот может и должен анализировать «на лету» — это файл robots.txt, чтобы не запрашивать адреса, которые в нем запрещены. При каждом сеансе сканирования сайта робот в первую очередь запрашивает этот файл, а уже после него — все стоящие в очереди на сканирование страницы.

Виды поисковых роботов

У каждой поисковой системы есть свой набор роботов для различных целей.
В основном они различаются по функциональному назначению, хотя границы очень условны, и каждый поисковик понимает их по-своему. Системам только для полнотекстового поиска вполне достаточно одного робота на все случаи жизни. У тех поисковиков, которые заняты не только текстом, боты разделяются как минимум на две категории: для текстов и рисунков. Существуют также отдельные боты, занятые специфическими видами контента — мобильным, блоговым, новостным, видео и т.д.

Читать:
Как завершить разговор на айфоне

Роботы Google

Все роботы Google носят общее название Googlebot. Основной робот-индексатор «представляется» так:

Второй из основных ботов занят сканированием изображений с сайта. Он «представляется» просто:

Еще в логах замечены как минимум три бота, занятых сбором контента для мобильной версии поиска. Поле User-agent всех трех оканчивается строкой:

Перед этой строкой — модель мобильного телефона, с которой этот бот совместим. У замеченных ботов это модели телефонов Nokia, Samsung и iPhone. Принимаемые типы контента — все, но с указанием приоритетов:

Роботы Яндекса

Из поисковиков, активно действующих в Рунете, самая большая коллекция ботов у Яндекса. В разделе помощи для вебмастеров можно найти официальный список всего паучьего личного состава. Приводить его здесь полностью нет смысла, поскольку в этом списке периодически происходят изменения. 1)
Тем не менее, о самых важных для нас роботах Яндекса нужно упомянуть отдельно.
Основной индексирующий робот на текущий момент зовется

Ранее представлялся как

С 31 июля 2009 года в этом списке было замечено существенное расширение (число типов почти удвоилось), а с 10 ноября 2009 года список укоротился до */* (все типы).
Этого робота живо интересует вполне определенный набор языков: русский, несколько менее украинский и белорусский, еще чуть меньше английский и совсем мало — все остальные языки.

Робот-сканер изображений несет в поле User-agent строку:

Занимается сканированием графики разных форматов для поиска в картинках.

В отличие от Google, у Яндекса есть отдельные боты для обслуживания некоторых специальных функций общего поиска.
Робот-«зеркальщик»

Ничего особенно сложного не делает — периодически появляется и проверяет, совпадает ли главная страница сайта при обращении к домену с www. и без. Также проверяет параллельные домены-«зеркала» на совпадение. По-видимому, зеркалами и канонической формой доменов в Яндексе занимается отдельный программный комплекс, не связанный напрямую с индексированием. Иначе решительно нечем объяснить существование для этой цели отдельного бота.

Сборщик иконок favicon.ico

Периодически появляется и запрашивает иконку favicon.ico, которая потом появляется в поисковой выдаче рядом со ссылкой на сайт. По каким причинам эту обязанность не совмещает сборщик картинок, неизвестно. По-видимому, также имеет место отдельный программный комплекс.

Проверочный бот для новых сайтов, работает при добавлении в форму AddURL

Робот Рамблера

В настоящее время уже не работает, поскольку Рамблер сейчас использует поиск Яндекса
Робота-индексатора Рамблера легко опознать в логах по полю User-agent

По сравнению с «коллегами» из других поисковых систем этот бот кажется совсем простым: не указывает список медиатипов (соответственно, получает запрошенный документ любого типа), поле Accept-Language в запросе отсутствует, в запросах бота не встречено также поле If-Modified-since.

Робот Mail.Ru

Об этом роботе пока известно немного. Разработку собственного поиска портал Mail.Ru ведет уже давно, но все никак не соберется этот поиск запустить. Поэтому достоверно известно только наименование бота в User-agent — Mail.Ru/2.0 (ранее — Mail.Ru/1.0). Наименование бота для директив файла robors.txt нигде не публиковалось, есть предположение, что бота так и следует звать Mail.Ru.

Прочие роботы

Поиск в интернете, конечно, не ограничивается двумя поисковыми системами. Поэтому существуют и другие роботы — например робот Bing — поисковой системы от Microsoft и другие роботы. Так, в частности, в Китае есть национальная поисковая система Baidu — но ее робот вряд ли долетит до середины реки дойдет до русского сайта 2) .

Кроме того, в последнее время расплодилось много сервисов — в частности solomono — которые хоть и не являются поисковыми системами, но тоже сканирует сайты. Часто ценность передачи информации о сайте таким системам сомнительна, и поэтому их роботов можно запретить в файле .htaccess — и нагрузка на сервер поменьше будет.

77.88.5.208 reported as spam 18 websites attacked, discovered Mar 31, 2020, last activity Nov 01, 2022 12:28:23.

Check IP Addresses, Email, Subnet, Domain for Spam in Blacklists Database

77.88.5.208 Status

Service Status Updated
Anti-Spam protection Not in list Nov 01, 2022 12:28:23
SpamFireWall [?] Not in list Nov 01, 2022 12:28:23
WordPress Security FireWall [?] Not in list
Type of attacks Spam

Blacklisted — a sender will be rejected by CleanTalk . Suspicious — a sender might be rejected by CleanTalk. The address will be included in Security FireWall if it is present in SpamFireWall and the option «Use CleanTalk database of dangerous IP addresses.» is turned on in Security settings.

Why CleanTalk? It’s simple.

Convenient registration/commenting forms increase the number of registrations. Real-Time Email Address Existence Validation to increase your conversion rate.

Our service allows you to focus your time on developing and improving the website and business, without being distracted by extraneous tasks.

Your visitors are more loyal and not annoyed guessing characters or puzzles. They become your regular visitors.

Похожие статьи