Les robots d'IA peuvent-ils vraiment lire votre site ?
Votre fichier robots.txt peut autoriser les intelligences artificielles pendant que votre pare-feu leur ferme la porte. Cet outil simule dix robots d'IA et mesure la réponse réelle de votre serveur. C'est le seul moyen de détecter cette contradiction, qui rend un site invisible dans ChatGPT, Claude, Perplexity et les aperçus IA de Google.
Gratuit, sans compte, sans limite journalièreOutil gratuit, sans inscription et sans limite journalière, édité par LANXAS, entreprise française d'intelligence artificielle. Les serveurs sont situés en France et aucune donnée d'analyse n'est conservée.
Pourquoi ce test existe
Depuis 2024, les moteurs de réponse remplacent progressivement la liste de liens bleus. Une part croissante des recherches se termine sans clic : l'internaute lit la réponse de l'IA. Pour figurer dans cette réponse, il faut d'abord que le robot de l'IA ait pu lire vos pages.
Or la plupart des sites ont installé une protection anti-robots, souvent activée par défaut chez leur hébergeur ou leur service de sécurité. Cette protection ne fait pas la différence entre un aspirateur malveillant et le robot de citation d'OpenAI. Le résultat est brutal : le site est parfaitement optimisé, son robots.txt invite les IA, et pourtant aucune IA ne le lit jamais.
Un fichier robots.txt est une déclaration d'intention. La réponse HTTP de votre serveur est un fait. Cet outil compare les deux.
Ce que l'outil mesure exactement
- La règle qui s'applique à chaque robot dans votre fichier robots.txt, avec la directive exacte qui décide.
- Le code de réponse réel de votre serveur quand ce robot demande votre page d'accueil.
- La contradiction éventuelle entre les deux, robot par robot.
- La distinction entre robots d'entraînement et robots de citation : bloquer les premiers est un choix légitime, bloquer les seconds vous prive de trafic.
- La présence d'un fichier llms.txt à la racine de votre site.
Les dix robots testés
| Robot | Propriétaire | Rôle |
|---|---|---|
| GPTBot | OpenAI | Entraînement des modèles ChatGPT |
| OAI-SearchBot | OpenAI | Citation dans la recherche ChatGPT |
| ChatGPT-User | OpenAI | Visite déclenchée par un utilisateur |
| ClaudeBot | Anthropic | Entraînement des modèles Claude |
| Claude-SearchBot | Anthropic | Citation dans les réponses Claude |
| PerplexityBot | Perplexity | Citation dans les réponses Perplexity |
| Google-Extended | Gemini et aperçus IA de la recherche | |
| CCBot | Common Crawl | Archive publique utilisée par de nombreux modèles |
| Bytespider | ByteDance | Entraînement |
| Applebot-Extended | Apple | Entraînement |
Comment corriger une contradiction
Si le test révèle que votre serveur refuse un robot que votre robots.txt autorise, la cause est presque toujours une protection anti-robots activée devant votre site. Chez Cloudflare, le réglage se trouve dans la section Sécurité, sous Bots, et s'appelle « Block AI bots » ou « AI Crawl Control ». Chez d'autres hébergeurs, cherchez « pare-feu applicatif » ou « protection anti-scraping ».
La bonne pratique consiste à distinguer les usages. Autorisez systématiquement les robots de citation, qui vous apportent des visiteurs. Décidez ensuite, selon votre modèle économique, si vous acceptez les robots d'entraînement, qui utilisent vos contenus sans contrepartie directe.
Questions fréquentes
Le test modifie-t-il quelque chose sur mon site ?
Faut-il créer un compte ?
Que signifie un code 403 ?
Bloquer les robots d'entraînement pénalise-t-il mon référencement classique ?
À quelle fréquence refaire le test ?
Tous les outils dans une seule application
Ces outils font partie de LANXAS SEO GEO, une application complète qui regroupe l'audit technique, la recherche de mots-clés, la visibilité dans les IA, la prospection et les rapports PDF. L'accès est gratuit.
Ouvrir LANXAS SEO GEO