SEO · техника
robots.txt мы читаем так же, как Яндекс и робот модели
Владелец открывает сайт в браузере и видит меню. Поиск открывает robots.txt и решает, заходить ли дальше. Если блог или карточки услуг закрыты «на всякий случай», ни статья, ни цена не попадут в индекс. Мы это видим в той же очереди, что витрина и семантика — не отдельным «техническим аудитом на 80 страниц».
Знаем типичные дыры: Disallow: / на User-agent: *, закрытый /blog при живых статьях, нет строки Sitemap, разные правила для Yandex и Googlebot скопированы слепо, GPTBot и робот GigaChat режутся тем же запретом, что служебный /kabinet. Каждую строку разбираем по роботу, не одним запретом на всех.
Строка с /blog закрывает людям справку и роботу GigaChat. Яндекс туда тоже не зайдёт.
- 1User-agent: Yandex
- 2Allow: /
- 3Disallow: /kabinet
- 4User-agent: Googlebot
- 5Allow: /
- 6User-agent: *
- 7Disallow: /blog
- 8Sitemap: https://clinic.ru/sitemap.xml
Оранжевым — то, что режем. Черновик правите вы. Автоматически не публикуем.
Что мы смотрим, чего не делает чекер из интернета
Онлайн-проверка «robots валиден» скажет, что синтаксис живой. Нам нужно другое: какие URL из ядра Wordstat закрыты, видит ли их Яндекс, видит ли Google, дойдёт ли GigaChat до абзаца с ценой. Один и тот же Disallow для человека в браузере ничего не значит — он файл не читает.
Host и Clean-param — про Яндекс. Sitemap — про обоих. Allow/Disallow для Googlebot не обязан совпадать с Yandex. Если закрыли фильтры каталога, это нормально. Если закрыли /uzi, потому что «там форма» — робот не увидит услугу, а статья в блоге будет висеть в пустоте.
| Робот | Код | robots | Что смотрел |
|---|---|---|---|
| YandexBot | 200 | открыт | /uzi, /vrachi |
| Googlebot | 200 | открыт | /uzi, /blog |
| Bingbot | 200 | открыт | те же URL |
| GigaChat | 403 | режет robots | /blog |
| GPTBot | 403 | режет robots | /blog |
Чем это сильнее «отдать программисту»
Программист правит файл, когда приходит тикет «откройте блог». Мы кладём конкретную строку в очередь недели: зачем открыть, кого это пустит, что случится с индексом. Черновик смотрите вы. Если строка спорная — оставляем как есть. Кабинет не живёт на FTP без человека.
Связка дальше простая. Открыли карточку — ставим цену. Есть спрос в Wordstat и нет URL — посадочная. Робот ходит, а регион «вся Россия» — Вебмастер. Файл robots сам по себе топ не двигает. Без него остальное часто бесполезно.
Преимущества
Почему robots.txt у нас — очередь дел, а не галочка «файл валиден»
Смотрим, кого пускает Яндекс, Google и робот модели. Закрытый блог «для людей» ломает индекс. Черновик строк подтверждаете вы.
Читаем файл как робот, не как валидатор
Синтаксис может быть живой, а /uzi закрыт. Чекер из интернета этого не свяжет с ядром. Открываете то, с чего заявки. Служебное оставляете закрытым.
Яндекс, Google и GigaChat — разные строки
Один Disallow на всех режет цитату модели и коммерцию в поиске разом. Правила по роботу. Не копируем запрет «на всякий случай».
Файл не уезжает на хостинг сам
Автофикс robots ломает разделы, о которых разработчик забыл сказать. Черновик смотрите вы. Можно оставить как есть.
Строка сразу становится задачей недели
Аудит пишет «проверьте robots». Мы пишем: открыть /blog, оставить /kabinet. Не тонет в PDF. Попадает в ту же очередь, что цена и title.
Частые вопросы
- Вы сами правите robots.txt на хостинге?
- Нет. Готовим черновик: что закрыто зря, кого пустить, какая строка Sitemap. Вы смотрите и подтверждаете. Кабинет сам файл не заливает.
- Если закрыть блог «для людей», поиск всё равно найдёт?
- Нет. Яндекс и Google читают тот же robots. GigaChat тоже. Закрытый «блог для людей» — частая причина, почему справку не индексируют, а модель берёт агрегатор.
- Нужны отдельные правила для каждого робота?
- Иногда да. Disallow для GPTBot не обязан совпадать с YandexBot. Мы показываем, кто упирается куда, и не копируем один запрет на всех «на всякий случай».
- llms.txt заменяет robots?
- Нет. robots решает, зайдёт ли робот. llms.txt — короткий указатель, если робот уже внутри. Без открытого доступа файл в корне ничего не чинит.