Vue dans vos journaux serveur

GET / HTTP/1.1 · "Mozilla/5.0 (compatible; TextBrut/0.1; +https://textbrut.fr/bot)"

À propos du robot TextBrut

Si vous avez trouvé cette ligne dans vos journaux, voici exactement ce qui s'est passé et comment l'empêcher de se reproduire.

Ce que fait ce robot

Il télécharge la page d'accueil publique de sites d'hôtels français pour mesurer quelle part du contenu est présente dans le code HTML initial, avant exécution du JavaScript.

C'est ce que reçoivent les robots des moteurs de réponse fondés sur l'IA, qui n'exécutent pas le JavaScript. Un site dont le contenu est injecté côté navigateur leur apparaît vide.

Ce qu'il ne fait pas

Comportement

Une seule visite par site. Deux requêtes au maximum, espacées d'au moins une seconde et demie. Le fichier robots.txt est lu avant toute requête et respecté.

Pour l'exclure

Ajoutez ces deux lignes à votre robots.txt. Elles sont prises en compte au passage suivant, sans avoir à nous écrire.

User-agent: TextBrut
Disallow: /

Contact

Une question, une contestation, une demande de retrait : contact@textbrut.fr. Réponse sous 24 heures, week-end compris.