list_ai_crawler_pages
Tool MCP list_ai_crawler_pages : les pages de votre site visitées par les robots IA, avec lectures pour répondre, indexation recherche, collecte entraînement, citations dans les réponses des IA, pages générées avec Mentionable et dernière visite.
Mis à jour le 2026-09-29
list_ai_crawler_pages liste les pages du site du projet que les robots IA ont visitées sur une période. Chaque ligne donne les visites, réparties en lectures pour répondre, indexation recherche et collecte entraînement, le nombre de fois où la page a été citée comme source dans les réponses aux prompts suivis, si la page a été générée avec Mentionable, et le jour de la dernière visite.
Les visites viennent de Cloudflare AI Crawl Control, synchronisées chaque nuit jusqu'à hier une fois le projet connecté à Cloudflare depuis sa page Robots IA. L'historique commence 7 jours avant la connexion.
Quand l'utiliser
Pour savoir quelles pages les assistants IA lisent vraiment : « quelles pages ChatGPT récupère-t-il pour répondre ? », « mes pages générées sont-elles visitées ? », « quelles pages sont très visitées mais jamais citées ? ».
Croiser les visites et les citations, c'est tout l'intérêt du tool. Une page avec beaucoup de lectures pour répondre et aucune citation est lue sans être créditée. Le tool lit des données déjà stockées et ne consomme aucun crédit.
Input
| Champ | Type | Défaut | Description |
|---|---|---|---|
projectId |
string (CUID) | requis | Projet interrogé. |
cursor |
string | Curseur opaque issu d'un pageInfo.nextCursor précédent. |
|
limit |
entier | 20 | De 1 à 100. |
filters.dateRange |
{ from?, to? } |
30 derniers jours complets | Jours UTC, bornes incluses. to vaut hier par défaut, le dernier jour synchronisé. |
filters.crawlers |
string[] | Identifiants de robots, par exemple chatgpt-user, gptbot, claudebot. |
|
filters.operators |
string[] | OpenAI, Anthropic, Perplexity, Mistral, DuckDuckGo, Apple, Amazon, Meta, ByteDance, Common Crawl. |
|
filters.kinds |
string[] | user (lectures pour répondre), search (indexation recherche), training (collecte entraînement). |
|
filters.pathContains |
string | Portion du chemin d'URL, sans tenir compte de la casse, 200 caractères au plus. | |
filters.generated |
booléen | true ne garde que les pages publiées avec Mentionable, false les exclut. |
|
filters.statusClasses |
string[] | 2xx, 3xx, 4xx, 5xx. Ne compte que les visites qui ont reçu un code de ces familles, par exemple ["4xx", "5xx"] pour les pages en erreur. Les pages sans ces visites sont écartées. |
|
sortBy |
enum | visits_desc |
visits_desc, answer_reads_desc, citations_desc, last_visit_desc. |
Les identifiants de robots, entreprises et types sont listés sur get_ai_crawler_overview. Les filtres robot, entreprise et type se cumulent et restreignent les visites comptées sur chaque page.
Réponse
data contient une ligne par page, pageInfo l'enveloppe de pagination habituelle, et summary la période réellement lue et le dernier jour synchronisé.
{
"data": [
{
"id": "/blog/checklist-audit-geo",
"path": "/blog/checklist-audit-geo",
"visits": 318,
"answerReads": 64,
"searchIndexing": 121,
"trainingCrawls": 133,
"citations": 9,
"generated": true,
"statuses": [{ "status": 200, "visits": 318 }],
"lastSeenAt": "2026-09-28"
},
{
"id": "/tarifs",
"path": "/tarifs",
"visits": 204,
"answerReads": 41,
"searchIndexing": 70,
"trainingCrawls": 93,
"citations": 0,
"generated": false,
"statuses": [{ "status": 200, "visits": 198 }, { "status": 404, "visits": 6 }],
"lastSeenAt": "2026-09-27"
}
],
"pageInfo": { "hasMore": true, "nextCursor": "20", "totalCount": 146 },
"summary": {
"connected": true,
"dateRange": { "from": "2026-08-30", "to": "2026-09-28" },
"syncedThrough": "2026-09-28"
}
}
idetpath: le chemin d'URL, sans le domaine et sans barre oblique finale. Passez-le tel quel àget_ai_crawler_page.visits: les visites sur la période, filtres robots appliqués.answerReads,searchIndexingettrainingCrawlsles répartissent par type.citations: le nombre de fois où une URL avec ce chemin, sur votre domaine ou l'un de ses sous-domaines, a été citée comme source dans une réponse à un prompt suivi sur la période. Tous les moteurs comptent, quels que soient les filtres robots.generated: true quand une page générée avec Mentionable a été publiée à ce chemin.statuses: codes HTTP renvoyés aux robots sur cette page avec leurs visites, les plus fréquents d'abord. Un4xxou5xxveut dire que le robot n'a pas pu lire la page.lastSeenAt: le dernier jour de la période avec une visite (YYYY-MM-DD).
Quand le projet n'est pas connecté à Cloudflare, le tool renvoie un data vide avec summary: { "connected": false }. Une période invalide (from après to) ou des filtres qui ne correspondent à aucun robot renvoient un data vide avec summary: { "connected": true }.
Conseils et patterns
- Filtrez
statusClasses: ["4xx", "5xx"]pour lister les pages que les robots IA n'ont pas pu lire, et corrigez-les en premier : une page illisible ne peut pas être citée. sortBy: "answer_reads_desc"classe les pages que les assistants récupèrent en direct pour répondre. Ce sont elles qu'il faut garder à jour et rapides.- Cherchez les lignes avec beaucoup d'
answerReadsetcitations: 0: le moteur lit la page sans la créditer. Lancez un Page Audit dessus avecrun_page_audit. filters: { generated: true }vérifie que les pages publiées avec Mentionable sont bien reprises, puisget_ai_crawler_pagedonne la chronologie de la publication à la première citation.filters: { pathContains: "/blog" }restreint la liste à une rubrique du site.sortBy: "last_visit_desc"fait remonter les pages visitées ces derniers jours, pratique juste après une publication.
Tools liés
get_ai_crawler_overview: totaux, tendances et erreurs de tout le siteget_ai_crawler_page: une page en détaillist_ai_crawler_visits: les lignes de visites brutes derrière ces totauxlist_llm_sources: tous les domaines cités ou cherchés par les LLM