Отслеживать
Робот уже был на сайте, а Метрика об этом молчит
Яндекс, Google, GPTBot, робот GigaChat. Смотрим сервер: кто стучался, какой код получил, не закрыт ли blog «на всякий случай». Без тега, который тормозит страницу.
- Где считаем
- Сервер, не JS
- Кого видим
- Яндекс, Google, GPT, GigaChat
- Счётчик
- Не обязателен
- Цифры
- Десятки заходов, не сотни тысяч
Если модели вас не цитируют, сначала проверьте, доходят ли они до страницы. Половина историй — закрытый раздел, 403 на справке, 404 на старом URL, который всё ещё торчит в индексе. Это не видно в Метрике и почти не видно в GA4. Видно в логе.
Кто ходит
Яндекс, Google, GPTBot, робот GigaChat. Не «191 тысяча визитов».
На обычном коммерческом сайте за месяц — десятки и сотни заходов ботов, не сотни тысяч. Яндекс и Google ходят чаще: они ищут. GPTBot и GigaChat — реже, и каждый промах больнее: один 403, и цитаты нет.
Смотрим, кого пускаете. Иногда blog закрыт «на всякий случай», а именно оттуда модели берут FAQ. Проверить руками можно в проверке обхода.
- YandexBotпоиск86
- Googlebotпоиск54
- GPTBotобучение21
- GigaChatответ12
- ChatGPT-Userцитата7
Люди из ответов
Клик из Алисы или ChatGPT Метрика часто кладёт в «прямые».
Человек переходит из ответа — реферер кривой или пустой. Мы пытаемся связать цитату в мониторинге и заход на ту же страницу в ближайшие часы. Это оценка, не идеальная атрибуция. Для «нас хоть кто-то открывает после ответа» хватает.
У МойСклада справка была за логином. Робот не заходил. После открытия документация попала и в индекс, и в ответы «как настроить».
- 07:16200/vkladyYandexBot
- 07:15200/vkladyGooglebot
- 07:14403/spravkaGPTBot
- 07:12200/tarifyGigaChat
Ошибки
404 и 500, которые видит бот. Страница для человека при этом живая.
Фильтры каталога отдают 500 роботу и 200 человеку. Справка закрыта авторизацией. Старый URL из блога 2024-го отдаёт 404, а модель всё ещё помнит его. Такие вещи чинятся точечно, без «технического аудита на 80 страниц».
Задача падает в Центр действий или в технический аудит, если дыр много.
- /blog/vklad-202440418
- /spravka/api4039
- /catalog?sort=price5004
Как подключаем
Не только Cloudflare. То, на чём сайт уже стоит.
1. Смотрим стек
Nginx, WordPress, Битрикс, Тильда, Selectel, Timeweb, Beget, иногда Cloudflare. Не тащим вас на чужой хостинг ради лога.
2. Открываем доступ
Кусок access-лога или лёгкий сборщик. Без тяжёлого тега на каждую страницу. На скорость сайта не садимся.
3. Связываем с цитатой
Если бот не ходит — чиним доступ. Если ходит, а цитаты нет — дело уже в тексте и витрине, не в robots.
Закрытый раздел
Типичный Disallow на /blog или /spravka. Для Яндекса ещё пролезает. Для GPTBot — нет. Дифф кладём в очередь, не применяем молча.
User-agent: GPTBot Allow: / User-agent: Yandex Allow: / - Disallow: /blog + Allow: /blog User-agent: GigaChat Allow: /
Правка черновиком. На сайт уйдёт после вашего «ок».
Живой лог
Не «реальное время для галочки». Достаточно видеть сегодняшний утренний обход: кто пришёл после вчерашней правки title.
- 07:16200/vkladyYandexBot
- 07:15200/vkladyGooglebot
- 07:14403/spravkaGPTBot
- 07:12200/tarifyGigaChat
Метрика считает людей. Мы — ещё и роботов.
| Метрика / GA4 | Аналитика роботов | |
|---|---|---|
| Как считает | Скрипт в браузере | Лог сервера |
| Яндекс, Google | Частично, как «боты» | Каждый заход, путь, код |
| GPTBot, GigaChat | Не видно | Видно |
| Человек из ответа ИИ | Часто «прямые» | Пытаемся связать с цитатой |
| 404 роботу | Нет | Список URL |
Преимущества
Почему лог роботов важнее красивого отчёта Метрики
Метрика показывает людей. Поиск и модели не зайдут, если robots закрыт, карточка отдаёт 403 или блог «для людей» запрещён. Мы это видим.
Ходим как Яндекс, Google, GPTBot и GigaChat
Обычный краулер смотрит «индексируется / нет». Мы разделяем поисковых роботов и роботов моделей — у них разные user-agent и разные запреты. Не ждёте цитаты в ChatGPT с раздела, который закрыт. Не вините «алгоритм», если дело в 403.
Находка сразу становится правкой
Аудит агентства пишет «проверьте robots». Мы кладём конкретный URL в очередь: открыть, отдать 200, убрать noindex. Разработчик получает задачу, а не главу из PDF на 80 страниц.
Видно то, чего не видит владелец
Макет красивый, человеку 200. Роботу — логин. Так устроены кабинеты врачей, калькуляторы и «закрытый прайс». Чините доступ раньше, чем заказываете пятую статью.
Без серых ботов и накрутки обхода
Не эмулируем клики и не «разгоняем» индексацию пакетом. Смотрим, как сайт отвечает честным роботам. Нет риска бана за накрутку. Только техника, которую можно объяснить.
Частые вопросы
- Зачем, если есть Метрика?
- Метрика считает людей в браузере. Роботы JavaScript не выполняют — их там нет. Человек, который пришёл из ответа Алисы, часто садится в «прямые». Мы смотрим сервер: кто стучался, что получил, откуда потом кликнули.
- Нужен ли счётчик на сайт?
- Для полной картины — доступ к логам хостинга или лёгкий сборщик. Базовые заходы Яндекса и Google видны и без него. WordPress, Битрикс, Тильда, Nginx на Selectel или Timeweb — подключаем то, что у вас есть, не только Cloudflare.
- Вы что-то меняете в robots сами?
- Нет. Кладём черновик правки в Центр действий. На сайт уйдёт после вашего «ок».
- Это 152-ФЗ и персональные данные?
- В логе роботов персональных данных почти нет: user-agent, путь, код ответа, время. Людей из ответа модели считаем без имён. Данные остаются в контуре проекта.