|
|
|
![]() |
Поисковые системы | Социальные сети Новости и обсуждения Google, Яндекс, Rambler, Yahoo, Aport, VK, OK, Twitter, Facebook, YouTube... |
![]() |
|
Опции темы | Поиск в этой теме |
![]() |
|
dast
Guest
Сообщений: n/a
|
![]()
Роботы поисковой системы, иногда их называют <пауки> или <кроулеры> (crawler) - это программные модули, занимающиеся поиском web-страниц. Как они работают? Что же они делают в действительности? Почему они важны?
Учитывая весь шум вокруг поисковой оптимизации и индексных баз данных поисковиков, вы, наверное думаете, что роботы должно быть великие и могущественные существа. Неправда. Роботы поисковика обладают лишь базовыми функциями, похожими на те, которыми обладали одни из первых броузеров, в отношении того, какую информацию они могут распознать на сайте. Как и ранние броузеры, роботы попросту не могут делать определенные вещи. Роботы не понимают фреймов, Flash анимаций, изображений или JavaScript. Они не могут зайти в разделы, защищенные паролем и не могут нажимать на все те кнопочки, которые есть на сайте. Они могут "заткнуться" в процессе индексирования динамических адресов URL и работать очень медленно, вплоть до остановки и безсилием над JavaScript-навигацией. Как работают роботы онлайн поисковой системы? Поисковые роботы стоит воспринимать, как программы автоматизированного получения данных, путешествующие по сети в поисках информации и ссылок на информацию. Когда, зайдя на страницу "Submit a URL", вы регистрируете очередную web-страницу в поисковике - в очередь для просмотра сайтов роботом добавляется новый URL. Даже если вы не регистрируете страницу, множество роботов найдет ваш сайт, поскольку существуют ссылки из других сайтов, ссылающиеся на ваш. Вот одна из причин, почему важно строить ссылочную популярность и размещать ссылки на других тематических ресурсах. Прийдя на ваш сайт, роботы сначала проверяют, есть ли файл robots.txt. Этот файл сообщает роботам, какие разделы вашего сайта не подлежат индексации. Обычно это могут быть директории, содержащие файлы, которыми робот не интересуется или ему не следовало бы знать. Роботы хранят и собирают ссылки с каждой страницы, которую они посещают, а позже проходят по этим ссылкам на другие страницы. Вся всемирная сеть построена из ссылок. Начальная идея создания Интернет сети была в том, что бы была возможность перемещаться по ссылкам от одного места к другому. Вот так перемещаются и роботы. "Остроумность" в отношении индексирования страниц в реальном режиме времени зависит от инженеров поисковых машин, которые изобрели методы, используемые для оценки информации, получаемой роботами поисковика. Будучи внедрена в базу данных поисковой машины, информация доступна пользователям, которые осуществляют поиск. Когда пользователь поисковой машины вводит поисковый запрос, производится ряд быстрых вычислений для уверенности в том, что выдается действительно правильный набор сайтов для наиболее релевантного ответа. Вы можете просмотреть, какие страницы вашего сайта уже посетил поисковый робот, руководствуясь лог-файлами сервера, или результатами статистической обработки лог-файла. Идентифицируя роботов, вы увидите, когда они посетили ваш сайт, какие страницы и как часто. Некоторые роботы легко идентифицируются по своим именам, как Google's "Googlebot". Другие более скрытые, как, например, Inktomi's "Slurp". Другие роботы так же могут встречаться в логах и не исключено, что вы не сможете сразу их идентифицировать; некоторые из них могут даже оказаться броузерами, которыми управляют люди. Помимо идентификации уникальных поисковых роботов и подсчета количества их визитов, статистика также может показать вам агрессивных, поглощающих ширину катала пропускания роботов или роботов, нежелательных для посещения вашего сайта. Как они читают страницы вашего web-сайта? Когда поисковой робот посещает страницу, он просматривает ее видимый текст, содержание различных тегов в исходном коде вашей страницы (title tag, meta tags, и т.д.), а так же гиперссылки на странице. Судя по словам ссылок, поисковая машина решает, о чем страница. Есть много факторов, используемых для вычисления ключевых моментов страницы "играющих роль". Каждая поисковая машина имеет свой собственный алгоритм для оценки и обработки информации. В зависимости от того, как робот настроен, информация индексируется, а затем доставляется в базу данных поисковой системы. После этого, информация, доставленная в индексные базы данных поисковой системы, становится частью поисковика и процесса ранжирования в базе. Когда посетитель существляет запрос, поисковик просматривает всю базу данных для выдачи конечного списка, релевантного поисковому запросу. Базы данных поисковых систем подвергаются тщательной обработке и приведению в соответствие. Если вы уже попали в базу данных, роботы будут навещать вас периодически для сбора любых изменений на страницах и уверенности в том, что обладают самой последней информацией. Количество посещений зависит от установок поисковой машины, которые могут варьироваться от ее вида и назначения. Иногда поисковые роботы не в состоянии проиндексировать web-сайт. Если ваш сайт упал или на сайт идет большое количество посетителей, робот может быть безсилен в попытках его индексации. Когда такое происходит, сайт не может быть переиндексирован, что зависит от частоты его посещения роботом. В большинстве случаев, роботы, которые не смогли достичь ваших страниц, попытаются позже, в надежде на то, что ваш сайт в ближайшее время будет доступен. Многие поисковые роботы не могут быть идентифицированы, когда вы просматриваете логи. Они могут посещать вас, но логи утверждают, что кто-то использует Microsoft броузер и т.д. Некоторые роботы идентифицируют себя использованием имени поисковика (googlebot) или его клона (Scooter = AltaVista). В зависимости от того, как робот настроен, информация индексируется, а затем доставляется в базы данных поисковой машины. Базы данных поисковых машин подвергаются модификации в различные сроки. Даже директории, имеющие вторичные поисковые результаты используют данные роботов как содержание своего web-сайта. Собственно, роботы не используются поисковиками лишь для вышеизложенного. Существуют роботы, которые проверяют баз данных на наличие нового содержания, навещают старое содержимое базы, проверяют, не изменились ли ссылки, загружают целые сайты для просмотра и так далее. По этой причине, чтение лог-файлов и слежение за выдачей поисковой системы помогает вам наблюдать за индексацией ваших проектов. |
Последний раз редактировалось LOOK; 27.06.2014 в 00:00. |
|
![]() |
![]() |
|
andy_levkovich
Бывалый
Оффлайн
Регистрация: 08.09.2009
Сообщений: 2,145
Поблагодарили 57 раз(а)
|
![]()
Все правильно, но нужно еще и обратить внимание на следующее:
Разработчики поисковых систем принимают меры по совершенствованию пауков. Сегодня практически все поисковые пауки умеют отсеивать поисковый спам вводимый в теги и скрытые поля. Проводить сравнительный анализ на осмысленность и соответствие содержанию ваших страниц. По этому, если в ключевые слова вы впишете слова «Москва», «Реферат», «Порно», «секс» и прочие слова, которые публикуются в списках популярных запросов, а робот не найдёт на ваших страницах материала соответствующего заголовку, то скорее всего ваш ресурс будет внесён в чёрный список и робот наведается к вам не очень скоро. Из этого следует, что страницы вашего сайта не будут проиндексированы и останутся, не известны. |
Последний раз редактировалось LOOK; 26.06.2014 в 23:59. |
|
![]() |
![]() |
||
Deasher
Заглянувший
Оффлайн
Регистрация: 21.02.2016
Сообщений: 3
Поблагодарили 0 раз(а)
|
![]() Цитата:
Даже если будет создан настоящий полноценный искусственный интеллект, все равно выдача поисковой системы зависит не только от содержания самих сайтов, а еще и в предсказании того, что именно нужно Задумайтесь, вы можете предсказать мысли и хотелки своих жен? Женская логика вообще делает ИИ в этом случае бессмысленным. |
|
![]() |
![]() |
||
Fialka
Студент
Оффлайн
Регистрация: 02.01.2016
Сообщений: 284
Поблагодарили 36 раз(а)
|
![]() Цитата:
|
|
![]() |
![]() |
|
Andrey77
Интересующийся
Оффлайн
Регистрация: 31.10.2016 Адрес: планета Земля
Сообщений: 7
Поблагодарили 0 раз(а)
|
![]()
Алгоритму ПС что-то не понравилось вот и выпадают, но бывают и глюки и очень часто, когда страницы и целые сайты выпадают просто так, без причины. Но потом в следующий апдейт возвращаются.
|
![]() |
![]() |
|
NEMO K
Студент
Оффлайн
Регистрация: 13.12.2012
Сообщений: 154
Поблагодарили 11 раз(а)
|
![]()
сейчас проверил сайт по хтул.
сообщение: из-за сбоя алгоритма яндекса - сайт не может быть проверен. в последнее время у яндекса как-то проблемы вообще с алгоритмами. |
![]() |
![]() |
|
Alex79
Интересующийся
Оффлайн
Регистрация: 08.07.2018
Сообщений: 1
Поблагодарили 0 раз(а)
|
![]()
Уважаемые, нуждаюсь в поиске конкретной технической информации, но являюсь обычным пользователем ПК и инета, к тому же необходим разовый поиск информации. Подскажите, к кому можно обратиться, кто может оказать мне услугу в поиске конкретной информации в инете. Поисковики Гугла, Яндекса и других обычных браузеров не находят необходимую мне информацию. Скачивать плагин-робот, ничего не понимаю, как это инсталировать на ПК, к тому же вроде как Гугл и другие поисковики не приветствуют такие плагины. Мне проще оплатить услугу в поиске разовой информации профессионалу айтишнику, который отышет мне информацию "по длинному хвосту", "лисьему хвосту". Подскажите форум, русскоязычный, где обитают подобные профи по "поисковым роботам"?
|
![]() |
![]() |
||
Fialka
Студент
Оффлайн
Регистрация: 02.01.2016
Сообщений: 284
Поблагодарили 36 раз(а)
|
![]() Цитата:
|
|
![]() |
![]() |
|
Заблокированный
Оффлайн
Регистрация: 20.10.2018
Сообщений: 6
Поблагодарили 0 раз(а)
|
![]() |
![]() |
![]() |
Метки |
поисковые, работают, роботы |
Опции темы | Поиск в этой теме |
![]() |
||||
Тема | Автор | Раздел | Последнее сообщение | |
Фотографии офисов Google. Вот в таких условиях работают буржуи Думаю вам будет интересно посмотреть в каких условиях работают сотрудники известного гуглы (по материалам harchenko.us) Торонто http://bestmasters.biz/files/office/toronto.jpg Цюрих... |
LOOK | Поисковые системы | Социальные сети | 13.10.2019 17:03 | |
Автоматическое добавление сайта в поисковые системы Автоматически добавить сайт в поисковые системы можно по ссылке ссылка --> Добавить сайт в поисковики проверенно, работает рекомендую Раскрутка сайта |
jkjk | Архив | 26.01.2017 15:47 | |
Роботы Яндекса меняют прописку Компания Яндекс сегодня сообщила, что на протяжении 2010 года все роботы компании сменят имя и свойства. По словам представителя компании Яндекс, основной целью этих изменений является улучшение... |
LOOK | Поисковые системы | Социальные сети | 08.05.2010 03:11 |
|
|
Текущее время: 14:59. Часовой пояс GMT +5.
|
| ||||||