Un singur Disallow greșit poate ascunde tot site-ul din Google. robots.txt pare simplu, dar felul în care se rezolvă conflictele între reguli e adesea surprinzător. Acest tester rulează exact logica Google pe regulile tale și pe URL-urile de test, direct în browser – ca să prinzi greșelile înainte de lansare.
Ce face verificatorul
Lipești conținutul robots.txt, dai un user-agent și o listă de URL-uri de testat. Pentru fiecare URL, instrumentul îți spune:
- dacă parcurgerea este permisă sau interzisă,
- care regulă decide (Allow sau Disallow, cu calea exactă).
Astfel nu ghicești, ci vezi negru pe alb ce permite și ce blochează robots.txt-ul.
Regula decisivă: cea mai lungă potrivire
Cel mai important lucru de înțeles: când unui URL i se potrivesc mai multe reguli, nu ordinea decide, ci specificitatea. Câștigă regula care potrivește cele mai multe caractere. La lungime egală, Allow este mai puternic decât Disallow.
| Regulă | Se potrivește la /admin/imagine.jpg | Lungime |
|---|---|---|
Disallow: /admin/ | Da | 7 |
Allow: /admin/*.jpg | Da | 11 |
Aici câștigă Allow, fiind mai lungă – deci URL-ul este permis, deși există un Disallow general.
Wildcard și sfârșit de linie
robots.txt suportă două instrumente de potrivire a tiparelor:
*– înlocuiește orice secvență de caractere.Disallow: /*.pdfblochează toate PDF-urile.$– fixează sfârșitul URL-ului.Disallow: /*.php$blochează doar URL-urile terminate în.php.
Efectul combinat al acestor tipare e greu de urmărit mental – de aceea un tester este util.
Disallow ≠ noindex
O confuzie frecventă: Disallow nu înseamnă că pagina nu apare în Google. Interzice parcurgerea, dar URL-ul poate apărea totuși în rezultate, fără titlu sau descriere. Pentru a scoate complet o pagină din index e nevoie de meta tag-ul noindex – iar acesta funcționează doar dacă parcurgerea este permisă (altfel motorul nu vede tag-ul).
De ce lipești conținutul, nu URL-ul
Instrumentul rulează în browserul tău, deci nu poate descărca robots.txt-ul altor domenii (restricții de securitate). Lipind conținutul, poți testa:
- un robots.txt încă nelansat, în pregătire,
- un fișier de pe un site intern sau de test,
- variante înainte și după o modificare.
Cum se folosește
- Lipește conținutul complet al robots.txt.
- Dă user-agent-ul (de exemplu Googlebot).
- Scrie URL-urile sau căile de testat, câte una pe rând.
- Citește pentru fiecare: permis sau interzis, și regula decisivă.
Confidențialitate: totul rămâne local
Toată analiza rulează în browserul tău, prin JavaScript. Regulile și URL-urile lipite nu ajung pe niciun server.
Instrumente înrudite
- Generator robots.txt — creează fișierul robots.txt cu un asistent
- Verificare URL-uri sitemap — listează URL-urile dintr-un sitemap XML
- Generator Meta Tag — inclusiv directiva robots la nivel de pagină
- Generator tag canonical — marchează versiunea oficială a paginilor