Vue dans vos journaux serveur
GET / HTTP/1.1 · "Mozilla/5.0 (compatible; TextBrut/0.1; +https://textbrut.fr/bot)"
À propos du robot TextBrut
Si vous avez trouvé cette ligne dans vos journaux, voici exactement ce qui s'est passé et comment l'empêcher de se reproduire.
Ce que fait ce robot
Il télécharge la page d'accueil publique de sites d'hôtels français pour mesurer quelle part du contenu est présente dans le code HTML initial, avant exécution du JavaScript.
C'est ce que reçoivent les robots des moteurs de réponse fondés sur l'IA, qui n'exécutent pas le JavaScript. Un site dont le contenu est injecté côté navigateur leur apparaît vide.
Ce qu'il ne fait pas
- Il ne collecte ni ne conserve aucune donnée personnelle.
- Il ne visite que la page d'accueil, jamais d'autre page.
- Il ne remplit aucun formulaire et ne tente aucune authentification.
- Il ne se déclare jamais sous l'identité d'un autre robot.
- Il ne contourne aucune protection et n'ignore aucun refus.
Comportement
Une seule visite par site. Deux requêtes au maximum, espacées d'au moins une seconde et demie. Le fichier robots.txt est lu avant toute requête et respecté.
Pour l'exclure
Ajoutez ces deux lignes à votre robots.txt. Elles sont prises en compte au passage suivant, sans avoir à nous écrire.
User-agent: TextBrut
Disallow: /
Contact
Une question, une contestation, une demande de retrait : contact@textbrut.fr. Réponse sous 24 heures, week-end compris.