Новость из категории: Информация

Что такое Robots.txt?

Что такое Robots.txt?

Действия seo-оптимизаторов порой кажутся довольно хаотичными. Но они всегда результативны. Хотя оптимизаторы в большинстве случаев работают с роботами — увеличивается количество реальных пользователей.

Сфера seo-оптимизации развивается очень быстрыми темпами. Но некоторые факторы остаются неизменными. Например, правильность и корректность формирования служебной файловой системы, частью которой является файл robots.txt. Абсолютно все поисковые роботы перед индексацией ресурса проводят работу с файлом «robots.txt», в идеале они извлекают его из корневой директории, но бывают моменты когда информация считывается с http://www.mydomain.com/robots.txt.

Что такое Robots.txt?

Этот файл содержит четкие инструкции для роботов-асессоров или, как их еще называют, пауков-индексаторов, какие страницы и файлы они могут индексировать, а какие нет. Без «robots.txt» качественная работа сайта невозможна. Изначально по наличию этого файла поисковые роботы определяют, создан сайт для пользователей или для стандартизированной генерации лидов. Формат у файла robots.txt — особый. Поскольку его чаще всего создают в блокноте, он полностью состоит из записей. Каждая запись содержит в себе два поля: строку с названием клиентского приложения (user-agent), и строку-директиву Disallow:
«:»

Robots.txt может быть создан в Блокноте, но по правилам лучше создавать его в адаптированной среде и правильно форматировать в Unix, после чего загрузить на хостинг... кстати, если вы находитесь в активном поиске последнего, то обязательно загляните на https://x5x.host: множество тарифов, гибкое ценообразование и стабильная работа - вот что отличает этого поставщика данной услуги от конкурентов. Большинство текстовых редакторов умеют превращать символы перевода строки Windows в языковую панель Unix. Есть вариант работы с FTP-клиентом. Лучше не использовать для редактирования HTML-редактор, он практически не интерпретирует код в правильном режиме.

Поле User-agent

Стандартизированная строка User-agent предназначена для того чтобы можно было ввести «имя» асессора. Для этой строки подходят не все поисковые роботы. Для обращения ко всем роботам лучше использовать символ подстановки «*». Это будет более правильно с точки зрения поисковой системы. Названия роботов можно найти в логах вашего веб-сервера. Большинство поисковых систем присваивают своим паукам-индексаторам короткие имена.

Что такое Robots.txt?

Disallow: email.htm

Директива Disallow: в ряде случаев содержит и название каталога. Строка после знака «:» сообщает роботу какие файлы и/или каталоги нельзя индексировать. Пример запрета на индексацию всех страниц с htm выглядит так:
Disallow:email.htm
Disallow: /cgi-bin/

Директива Disallow: /cgi-bin/ запрещает асессорам доступ к каталогу «cgi-bin». Также от пауков-индексаторов нужно скрыть директиву /bob , в идеале это — /bob.html и /bob/index.html. если вовремя не позаботиться об этом, поисковые роботы очень быстро выбросят сайт из выдачи, потому что в каталогах содержится информация, которая является конфиденциальной. Учтите, что если директива Disallow будет пустой — асессоры смогут индексировать ВСЕ файлы.

Минимум одна директива в Disallow должна присутствовать, отдельно это касается полей User-agent. В противном случае поисковая система будет фиксировать неправильность robots.txt или его отсутствие считался верным. Обратите внимание на тот факт, что строка в robots.txt, которая начинающаяся с #, считается комментарием. Поисковые системы допускают использовать комментарии в конце строк с директивами, но это не является плюсом сайту, скорее наоборот.

Disallow: bob #comment

Директива bob#comment запрещает роботу Roverdog индексировать все файлы сервера. Также эта директива запрещает роботу googlebot индексировать файл cheese.htm. Директива Allow не была утверждена.

Правильный синтаксис

Не редактируйте файл robots.txt в формате DOS. Закачивать файл на сайт лучше в режиме ASCII. Стандартные FTP-клиенты при закачке в текстовом режиме переводят символы строки из DOS-формата в UNIX-формат, то есть работа в таком формате удобнее всего.

Что такое Robots.txt?

Особенности Google

Google – единственный поисковый сервер, который стандартизировал в директивах регулярные выражения. Это позволяет запрещать индексацию указанных в robots файлов по их расширениям. В поле user-agent укажите имя «googlebot». Эта директива слишком важна, чтобы допускать к ней других роботов.
Значения мета-тега robots.txt

Атрибутика content содержит следующие значения: index, noindex, follow, nofollow. Директива INDEX дает доступ указанным в robots.txt роботам к определенным файлам и страницам. Директива FOLLOW разрешает роботам доступ ко всем указанным ссылкам. То есть ситуация выглядит примерно так: индексировать всё это INDEX, FOLLOW, не индексировать ничего — NOINDEX,NOFLLOW.

Рейтинг статьи

Оценка
0/5
голосов: 0
Ваша оценка статье по пятибальной шкале:
 
 
   

Поделиться

Похожие новости

Комментарии

^ Наверх