Screpy – outil d’audit SEO avec IA

Testeur et validateur gratuit de robots.txt

Les agents de recherche, d’entraînement et déclenchés par l’utilisateur peuvent avoir des fonctions différentes. Testez chaque jeton de produit séparément.

Aucun compte requis. Les URL et le contenu de robots.txt ne sont pas enregistrés.

Vérifiez si une URL est autorisée ou bloquée pour Google, la recherche IA, l’entraînement et les robots personnalisés. Testez un site en direct ou collez un fichier robots.txt pour voir la règle et la ligne appliquées.

Testez une règle d’exploration en trois étapes.

Vérifiez une URL sans créer de projet ni de compte. Le mode en direct lit uniquement le fichier robots.txt public du site.

01

Choisissez la source

Récupérez le fichier robots.txt public d’un site ou collez le contenu que vous souhaitez tester en privé dans votre navigateur.

02

Sélectionnez un robot

Choisissez un jeton de produit de recherche, de recherche IA, d’entraînement, déclenché par l’utilisateur ou personnalisé, puis saisissez le chemin à tester.

03

Lisez la correspondance exacte

Voyez si l’URL est autorisée, quel groupe s’applique et quelle règle Allow ou Disallow ainsi que sa ligne déterminent le résultat.

Comprenez pourquoi un robot est autorisé ou bloqué.

Un résultat utile doit montrer la règle qui motive la décision, pas seulement un statut vert ou rouge.

La règle la plus spécifique gagne

Le testeur applique le comportement de correspondance la plus longue. En cas de conflit entre des règles Allow et Disallow aussi spécifiques, la règle Allow, moins restrictive, gagne.

Correspondance des jokers et de la fin

Utilisez un astérisque pour correspondre à une suite de caractères et un signe dollar pour ancrer une règle à la fin de l’URL testée.

Les groupes User-Agent comptent

Un groupe propre à un robot est prioritaire sur le groupe global *. Les robots de recherche, d’entraînement et déclenchés par l’utilisateur doivent être testés séparément.

Aucune règle signifie un accès par défaut

Lorsqu’aucune règle Allow ou Disallow applicable ne correspond, l’URL est autorisée par défaut selon le protocole d’exclusion des robots.

Robots.txt contrôle l’accès, pas l’inclusion dans les résultats de recherche.

Contrôle du crawl

Les règles Allow et Disallow indiquent à un robot compatible quels chemins d’URL il peut demander.

Contrôle de l’indexation

Utilisez des directives noindex explorables et les procédures de retrait des moteurs lorsqu’une URL ne doit pas apparaître dans les résultats.

Questions sur le testeur robots.txt

Des réponses claires sur les règles d’exploration, les jetons des robots IA, les erreurs et l’indexation.

Que fait un testeur robots.txt ?

Un testeur robots.txt compare un user-agent et une URL aux règles d’un fichier robots.txt. Il indique si l’exploration est autorisée, quel groupe User-Agent s’applique et quelle règle correspond exactement lorsqu’il y en a une.

Robots.txt empêche-t-il l’indexation d’une page ?

Pas à lui seul. Robots.txt contrôle l’exploration, pas l’indexation. Une URL bloquée peut être découverte par des liens et apparaître sans extrait complet. Utilisez une directive noindex adaptée sur une page explorable si vous voulez la retirer des résultats.

Que signifie « Autorisé par défaut » ?

Cela signifie que le testeur n’a trouvé aucune règle applicable qui bloque l’URL. Il peut ne pas y avoir de groupe User-Agent correspondant, de règle pertinente dans le groupe ou de fichier robots.txt utilisable.

Puis-je tester les robots IA séparément de Googlebot ?

Oui. Les robots de recherche, de recherche IA, d’entraînement des modèles et de récupération déclenchée par l’utilisateur utilisent des jetons différents et peuvent suivre des règles différentes. Sélectionnez chaque agent séparément pour vérifier la règle applicable.

Que signifient * et $ dans robots.txt ?

Un astérisque correspond à une suite de caractères dans un chemin d’URL. Un signe dollar ancre un motif à la fin de l’URL. Le testeur prend en charge les deux motifs pour identifier la règle applicable la plus spécifique.

Que se passe-t-il si robots.txt renvoie un 404 ou un 403 ?

Les principaux robots traitent généralement la plupart des réponses 4xx comme si aucune restriction d’exploration n’était publiée. Une réponse 429 signale une limitation temporaire ; le testeur indique donc un état en direct indéterminé.

Pourquoi un résultat 5xx ou un délai d’attente est-il indéterminé ?

Une erreur temporaire du serveur ou du réseau ne prouve pas qu’un robot est autorisé ou bloqué. Les robots peuvent suspendre leurs requêtes ou réutiliser un fichier robots.txt mis en cache ; le testeur évite donc une décision définitive.

Screpy stocke-t-il les URL ou le contenu robots.txt collé ?

Non. Le contenu collé est analysé dans votre navigateur et n’est pas téléversé. Le mode direct envoie seulement le site, l’URL testée et le robot sélectionné pour le contrôle en cours ; ces données ne sont pas stockées.