- Что такое robots.txt и для чего он нужен
- Что такое sitemap.xml и как работает с robots
- Синтаксис robots.txt и основные директивы
- Готовые примеры robots.txt для разных сайтов
- Как создать и разместить robots.txt
- Настройка sitemap.xml: структура и правила
- Как добавить sitemap в Search Console и Вебмастер
- Частые ошибки при настройке
- FAQ: ответы на частые вопросы
- Итог и чек-лист
1. Что такое robots.txt и для чего он нужен
Robots.txt — это текстовый файл в корне сайта, который даёт инструкции поисковым роботам: какие разделы можно сканировать, какие — нет. Файл должен быть доступен по адресу site.kz/robots.txt. Роботы Google, Яндекса, Bing и других поисковиков читают его при каждом заходе на сайт и следуют указанным правилам.
Важный момент: robots.txt — это рекомендация, а не запрет. Добропорядочные поисковые боты правилам подчиняются, но файл не защитит от скраперов и парсеров, которые игнорируют стандарт. Для реальной защиты раздела сайта нужна авторизация или блокировка на уровне сервера.
Что robots.txt решает
- Закрывает от индексации технические разделы: админку, корзину, страницы фильтров, дубликаты
- Экономит краулинговый бюджет — роботы не тратят лимит на ненужные URL
- Указывает путь к sitemap.xml — помогает поисковикам быстрее найти все важные страницы
- Управляет скоростью сканирования через Crawl-delay (для Яндекса)
- Задаёт разные правила для разных роботов: Googlebot, Yandex, Bingbot
Одна ошибка в robots.txt может обрушить индексацию всего сайта. Классический пример — оставить после разработки директиву «Disallow: /», которая закрывает весь сайт от всех роботов. Это приводит к вылету из выдачи на 2–4 недели после того, как ошибка будет замечена.
2. Что такое sitemap.xml и как работает с robots
Sitemap.xml — это XML-файл со списком всех страниц сайта, которые должны попасть в индекс. Для каждой страницы в sitemap можно указать дату последнего изменения, приоритет и частоту обновления. Sitemap помогает поисковикам быстрее находить и переобходить страницы — особенно важно для крупных сайтов и новых проектов.
Как работают robots.txt и sitemap.xml вместе
- Поисковый робот заходит на сайт и первым делом читает robots.txt
- В robots.txt находит директиву Sitemap: путь_к_карте_сайта
- Переходит по указанному адресу и скачивает sitemap.xml
- Получает полный список URL для обхода и отправляется сканировать их по очереди
Без sitemap робот будет искать страницы через ссылки с главной — медленно и с пропусками. Без robots.txt робот будет заходить во все разделы подряд, включая лишние. Оба файла нужны вместе.
3. Синтаксис robots.txt и основные директивы
Файл состоит из секций. Каждая секция начинается с директивы User-agent (кому адресовано правило), далее идут Disallow и Allow. Основные директивы:
| Директива | Назначение | Пример |
|---|---|---|
| User-agent | Для какого робота действует правило. * — для всех | User-agent: * |
| Disallow | Запретить сканирование пути | Disallow: /admin/ |
| Allow | Разрешить сканирование (приоритет выше Disallow) | Allow: /admin/public/ |
| Sitemap | Путь к карте сайта, полный URL | Sitemap: https://site.kz/sitemap.xml |
| Clean-param | Яндекс: игнорировать GET-параметры в URL | Clean-param: utm_source |
| Host | Устаревшая директива Яндекса — больше не используется | — |
Правила записи путей
- /admin/ — закрывает всё, что начинается с /admin/
- /*.pdf$ — закрывает все PDF-файлы на сайте (звёздочка — любое количество символов, $ — конец URL)
- *? — закрывает URL с параметрами (удобно для страниц сортировки и фильтров)
- /search — закрывает и /search, и /search/anything, и /search?q=word
- Disallow: (пустое значение) — разрешает всё (противоположность Disallow: /)
4. Готовые примеры robots.txt для разных сайтов
Для сайта-визитки на WordPress
Минимальный функционал, закрываем только техническое:
- User-agent: *
- Disallow: /wp-admin/
- Allow: /wp-admin/admin-ajax.php
- Disallow: /wp-login.php
- Disallow: /?s=
- Disallow: /search/
- Sitemap: https://site.kz/sitemap_index.xml
Для интернет-магазина на WooCommerce
Дополнительно закрываем корзину, оформление заказа, страницы фильтров:
- User-agent: *
- Disallow: /wp-admin/
- Allow: /wp-admin/admin-ajax.php
- Disallow: /cart/
- Disallow: /checkout/
- Disallow: /my-account/
- Disallow: /*add-to-cart=*
- Disallow: /*?orderby=
- Disallow: /*?filter_
- Disallow: /*?min_price=
- Sitemap: https://site.kz/sitemap_index.xml
Для новостного сайта или блога
Открываем всё полезное для индексации, закрываем только дубли и технические страницы:
- User-agent: *
- Disallow: /wp-admin/
- Allow: /wp-admin/admin-ajax.php
- Disallow: /author/
- Disallow: /tag/
- Disallow: /*?replytocom=
- Disallow: /page/*/feed
- Sitemap: https://site.kz/sitemap_index.xml
Не блокируйте в robots.txt CSS и JS файлы темы. Google нужен доступ к этим файлам, чтобы увидеть сайт так же, как видит пользователь. Если заблокировать /wp-includes/ полностью — Google пометит сайт как «не мобильно-адаптированный» даже при идеальной вёрстке.
5. Как создать и разместить robots.txt
Создайте файл в текстовом редакторе
Открывайте обычный текстовый редактор (Блокнот, Notepad++, VS Code). Не используйте Word — он добавит форматирование и лишние символы. Файл должен быть в кодировке UTF-8 без BOM.
Напишите правила
Начинайте с User-agent: *. Добавьте нужные Disallow/Allow. В конце укажите Sitemap: с полным URL. Проверьте, что нет опечаток в путях.
Сохраните файл
Имя файла строго robots.txt — в нижнем регистре, без расширений .txt.txt. Размер файла не больше 500 КБ (ограничение Google).
Загрузите в корень сайта
Файл должен лежать в корневой директории, доступ по адресу site.kz/robots.txt. Не в /wp-content/ и не в /public_html/files/ — именно в корне.
Проверьте доступность
Откройте https://site.kz/robots.txt в браузере — файл должен отображаться текстом. Если видите 404 или HTML-страницу — файл загружен не туда.
Для WordPress: плагины, которые создают robots.txt
- Rank Math — редактор robots.txt прямо в админке, автоматическая синхронизация
- Yoast SEO — раздел «Инструменты» → «Редактор файлов», даёт править robots.txt без FTP
- All in One SEO — встроенный редактор с подсказками
6. Настройка sitemap.xml: структура и правила
Sitemap.xml — это XML-файл в стандартизированном формате. Для обычного сайта структура следующая:
Что содержит каждая запись о странице
- loc — полный URL страницы (обязательно)
- lastmod — дата последнего изменения в формате ISO 8601 (2026-04-16T12:00:00+06:00)
- changefreq — частота изменения: always, hourly, daily, weekly, monthly, yearly, never
- priority — приоритет от 0.0 до 1.0 (главная = 1.0, глубокие страницы = 0.3–0.5)
Правила составления sitemap
- Один sitemap содержит максимум 50 000 URL
- Размер файла — не больше 50 МБ в распакованном виде
- Для больших сайтов используется индекс sitemap (sitemap_index.xml), который ссылается на несколько отдельных карт
- В sitemap включают только canonical-версии страниц, без дубликатов
- Закрытые в robots.txt страницы в sitemap добавлять не нужно
- Все URL в sitemap должны быть с одним и тем же доменом и протоколом (https)
Разделение на несколько sitemap
Для крупных сайтов принято делить карту на несколько файлов по типу контента: post-sitemap.xml (статьи), page-sitemap.xml (страницы), product-sitemap.xml (товары), category-sitemap.xml (категории). Они все перечислены в sitemap_index.xml — это упрощает диагностику проблем индексации.
На WordPress не нужно создавать sitemap руками. Rank Math, Yoast SEO и All in One SEO генерируют sitemap автоматически и обновляют его при добавлении/удалении контента. Стандартный путь — site.kz/sitemap_index.xml или site.kz/sitemap.xml.
7. Как добавить sitemap в Search Console и Вебмастер
Google Search Console
- Войдите в Google Search Console → выберите нужный домен
- Раздел «Индексирование» → «Файлы Sitemap»
- В поле «Добавить файл Sitemap» укажите путь: sitemap.xml или sitemap_index.xml
- Нажмите «Отправить»
- Через 1–3 дня появится статус: «Успешно» или «Ошибка» — при ошибке отчёт покажет, какие URL проблемные
Яндекс.Вебмастер
- Войдите в Яндекс.Вебмастер → выберите сайт
- Раздел «Индексирование» → «Файлы Sitemap»
- Нажмите «Добавить файл Sitemap»
- Вставьте полный URL: https://site.kz/sitemap.xml
- Ожидайте обхода — обычно 1–2 дня до первого анализа
Bing Webmaster Tools
Если целевая аудитория включает международные рынки — добавьте sitemap и в Bing. Процесс аналогичный, раздел «Configure My Site» → «Sitemaps».
8. Частые ошибки при настройке
Ошибка 1. Disallow: / на продакшене
Типичная история: разработчики оставили заглушку после запуска сайта, и директива «Disallow: /» закрыла всё от индексации. Первое, что нужно проверить после запуска — открыть robots.txt и убедиться, что нет глобальных запретов.
Ошибка 2. Блокировка CSS и JS
Запрет доступа к /wp-content/themes/ или /wp-includes/ мешает Google рендерить страницу. Это приводит к проблемам с Mobile-Friendly Test и может снизить позиции. Оставляйте доступ к CSS и JS.
Ошибка 3. Неправильный путь к sitemap в robots.txt
Путь должен быть абсолютным: Sitemap: https://site.kz/sitemap.xml, а не /sitemap.xml. Относительный путь робот не обработает.
Ошибка 4. Sitemap с 404-страницами
Если в sitemap попали URL, которые возвращают 404 или 301-редирект — это негативный сигнал. Проверяйте sitemap на валидность через Search Console.
Ошибка 5. Конфликт robots.txt и noindex
Если страница закрыта и в robots.txt, и через meta robots noindex — Google не сможет прочитать тег noindex (доступ же заблокирован). В итоге страница может остаться в индексе. Для удаления из индекса используйте только noindex, а не запрет в robots.
Ошибка 6. Слишком детальный sitemap
Включать в sitemap все URL подряд, включая страницы пагинации, фильтров, UTM-разметок — плохая практика. В sitemap должны быть только canonical-URL основных страниц.
Ошибка 7. Редкое обновление sitemap
Если сайт на статичном HTML и sitemap не обновляется автоматически — после каждого нового поста или страницы нужно пересобирать карту. Иначе поисковик не узнает о свежем контенте вовремя.
9. FAQ: ответы на частые вопросы
Обязателен ли robots.txt для сайта?
Технически нет — без robots.txt роботы сканируют всё по умолчанию. Но для любого серьёзного сайта файл обязателен: он экономит краулинговый бюджет и закрывает технические разделы от индексации.
Robots.txt и meta robots — в чём разница?
Robots.txt запрещает роботу заходить на страницу (сканировать). Meta robots noindex разрешает зайти, но запрещает добавлять в индекс. Это разные механизмы: для удаления страницы из индекса нужен именно noindex, robots.txt этого не делает.
Нужен ли sitemap для маленького сайта из 10 страниц?
Да, хотя эффект будет меньше. Для маленьких сайтов sitemap не критичен — Google и так найдёт все страницы через внутренние ссылки. Но лучше подключить: это 2 минуты работы и нулевые риски.
Как часто должен обновляться sitemap?
Автоматически — при каждом добавлении или изменении контента. Если используете SEO-плагин (Rank Math, Yoast), это делается без вашего участия. Для ручного sitemap — после любого значимого изменения структуры.
Можно ли иметь несколько robots.txt для поддоменов?
Да и даже нужно. Каждый поддомен — это отдельный хост для поисковиков, у него свой robots.txt. Например, shop.site.kz и blog.site.kz должны иметь разные файлы.
Как проверить, что robots.txt работает правильно?
В Google Search Console есть «Тестер файла robots.txt» — он покажет, какие URL закрыты, какие открыты. В Яндекс.Вебмастере — раздел «Инструменты» → «Анализ robots.txt». Проверяйте после любого изменения.
10. Итог: чек-лист для настройки
Пройдитесь по списку после настройки robots.txt и sitemap.xml:
- Файл robots.txt создан и доступен по site.kz/robots.txt
- Нет директивы Disallow: / для всех роботов
- Закрыты технические разделы (/admin/, /cart/, /checkout/, внутренний поиск)
- Открыт доступ к CSS и JS темы
- Указан Sitemap: с полным URL
- Sitemap.xml сгенерирован и доступен
- В sitemap только canonical-URL без дубликатов
- В sitemap нет 404 и страниц с редиректами
- Размер sitemap не превышает 50 МБ и 50 000 URL
- Для больших сайтов используется sitemap_index.xml
- Sitemap добавлен в Google Search Console
- Sitemap добавлен в Яндекс.Вебмастер
- Обход проверен через тестер robots.txt в Search Console
- Автообновление sitemap настроено (через плагин или самописный скрипт)
- Проверка robots.txt включена в чек-лист деплоя — чтобы не оставить Disallow: / случайно
Настроим robots.txt и sitemap.xml для вашего сайта
Команда IPROD проверит текущую настройку, уберёт ошибки, закроет технические разделы и подключит sitemap к Google Search Console и Яндекс.Вебмастеру. Работаем с WordPress, WooCommerce, Bitrix и кастомными CMS по всему Казахстану.

