Зрозумілі правила сканування без випадкового блокування сайту
Robots.txt повідомляє пошуковим роботам, які URL вони можуть сканувати. У WordPress файл може генеруватися автоматично, змінюватися SEO-плагіном або бути фізично розміщеним у корені сайту. Якщо ці джерела конфліктують, Google може не отримати важливі сторінки, стилі чи скрипти або витрачати ресурси на непотрібні технічні адреси.
Спочатку визначаємо, звідки фактично віддається robots.txt: із WordPress, фізичного файла, плагіна, сервера або CDN. Потім перевіряємо правила для wp-admin, admin-ajax.php, wp-content, uploads, пошуку, RSS-стрічок, параметрів і службових сторінок WooCommerce.
Для магазину окремо аналізуємо кошик, оформлення замовлення, особистий кабінет, сортування, фільтри та URL із параметрами. Там, де сторінку потрібно прибрати з пошуку, використовуємо відповідний noindex або інший механізм, а не покладаємося лише на Disallow.
Коли потрібне налаштування robots.txt
- Google Search Console повідомляє, що важливий ресурс або сторінку заблоковано
- за адресою /robots.txt відображаються неочікувані чи застарілі правила
- WordPress, SEO-плагін і фізичний файл формують різний результат
- після розробки або міграції сайт залишився закритим від пошукових систем
- у налаштуваннях читання активовано заборону індексації сайту
- заблоковано admin-ajax.php, CSS, JavaScript або зображення, потрібні для сторінок
- WooCommerce створює багато URL кошика, кабінету, пошуку, сортування чи фільтрів
- XML Sitemap не вказаний або robots.txt посилається на старий домен
- після встановлення плагіна змінилися правила сканування
- потрібно зменшити сканування непотрібних параметричних URL