list_ai_crawler_pages

Tool MCP list_ai_crawler_pages : les pages de votre site visitées par les robots IA, avec lectures pour répondre, indexation recherche, collecte entraînement, citations dans les réponses des IA, pages générées avec Mentionable et dernière visite.

Mis à jour le 2026-09-29

list_ai_crawler_pages liste les pages du site du projet que les robots IA ont visitées sur une période. Chaque ligne donne les visites, réparties en lectures pour répondre, indexation recherche et collecte entraînement, le nombre de fois où la page a été citée comme source dans les réponses aux prompts suivis, si la page a été générée avec Mentionable, et le jour de la dernière visite.

Les visites viennent de Cloudflare AI Crawl Control, synchronisées chaque nuit jusqu'à hier une fois le projet connecté à Cloudflare depuis sa page Robots IA. L'historique commence 7 jours avant la connexion.

Quand l'utiliser

Pour savoir quelles pages les assistants IA lisent vraiment : « quelles pages ChatGPT récupère-t-il pour répondre ? », « mes pages générées sont-elles visitées ? », « quelles pages sont très visitées mais jamais citées ? ».

Croiser les visites et les citations, c'est tout l'intérêt du tool. Une page avec beaucoup de lectures pour répondre et aucune citation est lue sans être créditée. Le tool lit des données déjà stockées et ne consomme aucun crédit.

Input

Champ Type Défaut Description
projectId string (CUID) requis Projet interrogé.
cursor string Curseur opaque issu d'un pageInfo.nextCursor précédent.
limit entier 20 De 1 à 100.
filters.dateRange { from?, to? } 30 derniers jours complets Jours UTC, bornes incluses. to vaut hier par défaut, le dernier jour synchronisé.
filters.crawlers string[] Identifiants de robots, par exemple chatgpt-user, gptbot, claudebot.
filters.operators string[] OpenAI, Anthropic, Perplexity, Mistral, DuckDuckGo, Apple, Amazon, Meta, ByteDance, Common Crawl.
filters.kinds string[] user (lectures pour répondre), search (indexation recherche), training (collecte entraînement).
filters.pathContains string Portion du chemin d'URL, sans tenir compte de la casse, 200 caractères au plus.
filters.generated booléen true ne garde que les pages publiées avec Mentionable, false les exclut.
filters.statusClasses string[] 2xx, 3xx, 4xx, 5xx. Ne compte que les visites qui ont reçu un code de ces familles, par exemple ["4xx", "5xx"] pour les pages en erreur. Les pages sans ces visites sont écartées.
sortBy enum visits_desc visits_desc, answer_reads_desc, citations_desc, last_visit_desc.

Les identifiants de robots, entreprises et types sont listés sur get_ai_crawler_overview. Les filtres robot, entreprise et type se cumulent et restreignent les visites comptées sur chaque page.

Réponse

data contient une ligne par page, pageInfo l'enveloppe de pagination habituelle, et summary la période réellement lue et le dernier jour synchronisé.

{
  "data": [
    {
      "id": "/blog/checklist-audit-geo",
      "path": "/blog/checklist-audit-geo",
      "visits": 318,
      "answerReads": 64,
      "searchIndexing": 121,
      "trainingCrawls": 133,
      "citations": 9,
      "generated": true,
      "statuses": [{ "status": 200, "visits": 318 }],
      "lastSeenAt": "2026-09-28"
    },
    {
      "id": "/tarifs",
      "path": "/tarifs",
      "visits": 204,
      "answerReads": 41,
      "searchIndexing": 70,
      "trainingCrawls": 93,
      "citations": 0,
      "generated": false,
      "statuses": [{ "status": 200, "visits": 198 }, { "status": 404, "visits": 6 }],
      "lastSeenAt": "2026-09-27"
    }
  ],
  "pageInfo": { "hasMore": true, "nextCursor": "20", "totalCount": 146 },
  "summary": {
    "connected": true,
    "dateRange": { "from": "2026-08-30", "to": "2026-09-28" },
    "syncedThrough": "2026-09-28"
  }
}
  • id et path : le chemin d'URL, sans le domaine et sans barre oblique finale. Passez-le tel quel à get_ai_crawler_page.
  • visits : les visites sur la période, filtres robots appliqués. answerReads, searchIndexing et trainingCrawls les répartissent par type.
  • citations : le nombre de fois où une URL avec ce chemin, sur votre domaine ou l'un de ses sous-domaines, a été citée comme source dans une réponse à un prompt suivi sur la période. Tous les moteurs comptent, quels que soient les filtres robots.
  • generated : true quand une page générée avec Mentionable a été publiée à ce chemin.
  • statuses : codes HTTP renvoyés aux robots sur cette page avec leurs visites, les plus fréquents d'abord. Un 4xx ou 5xx veut dire que le robot n'a pas pu lire la page.
  • lastSeenAt : le dernier jour de la période avec une visite (YYYY-MM-DD).

Quand le projet n'est pas connecté à Cloudflare, le tool renvoie un data vide avec summary: { "connected": false }. Une période invalide (from après to) ou des filtres qui ne correspondent à aucun robot renvoient un data vide avec summary: { "connected": true }.

Conseils et patterns

  • Filtrez statusClasses: ["4xx", "5xx"] pour lister les pages que les robots IA n'ont pas pu lire, et corrigez-les en premier : une page illisible ne peut pas être citée.
  • sortBy: "answer_reads_desc" classe les pages que les assistants récupèrent en direct pour répondre. Ce sont elles qu'il faut garder à jour et rapides.
  • Cherchez les lignes avec beaucoup d'answerReads et citations: 0 : le moteur lit la page sans la créditer. Lancez un Page Audit dessus avec run_page_audit.
  • filters: { generated: true } vérifie que les pages publiées avec Mentionable sont bien reprises, puis get_ai_crawler_page donne la chronologie de la publication à la première citation.
  • filters: { pathContains: "/blog" } restreint la liste à une rubrique du site.
  • sortBy: "last_visit_desc" fait remonter les pages visitées ces derniers jours, pratique juste après une publication.

Tools liés

Vous pouvez voir où vous en êtes dès aujourd'hui.

Essai gratuit. Lancez le suivi de votre visibilité IA, sans carte.