Lorsqu’un contenu web manque, testez un article précis depuis son URL publique jusqu’au mode de collecte configuré. La cause vient généralement de l’accessibilité, de la source, de l’URL canonique, des métadonnées, d’un filtre ou du délai de collecte — pas seulement du fait que la page fonctionne dans votre navigateur.

1. Tester l’URL publique finale#
Ouvrez l’URL canonique exacte de l’article dans une fenêtre de navigation privée. Elle doit répondre 200 sans connexion, mur de consentement, restriction géographique, 401, 403, 404 ni défi anti-robot. Suivez les redirections et testez l’URL finale, pas uniquement la page d’accueil. Un pare-feu applicatif (WAF) peut autoriser votre navigateur tout en bloquant un crawler.
Si votre site limite les robots, utilisez la liste et les points de vérification actuels de Mettre en place Nonli sur votre site. Les points d’accès lisibles par machine /crawler-ips.json et /crawler-ips.txt publient actuellement uniquement des adresses de sortie IPv4 ; Nonli ne publie actuellement aucune adresse IPv6 de crawler à autoriser. Ce guide et ces points d’accès sont la source de vérité pour le SDK et les adresses du crawler : ne recopiez pas une ancienne adresse reçue dans un message de support.
2. Identifier le mode de collecte#
Chaque mode possède ses propres prérequis :
- SDK Nonli : le script doit charger sur chaque gabarit d’article éligible et être activé pour la marque. Dans un gestionnaire de balises, vérifiez que le consentement, les exclusions d’URL, l’environnement de prévisualisation ou les déclencheurs n’écartent pas les pages d’article.
- RSS : l’article doit exister dans le flux configuré avec une URL stable et une date de publication. Consultez le guide du flux RSS.
- Rafraîchissement d’URL directe : l’URL finale et ses métadonnées doivent être accessibles au moment du rafraîchissement.
- Social listening : les comptes et filtres de la source sociale, et non le SDK du site, déterminent les résultats.
3. Vérifier le domaine, l’URL canonique et les métadonnées#
Confirmez que le site est rattaché à la bonne marque et que son domaine apparaît dans le filtre Source. Sur l’article, inspectez l’URL canonique finale et les métadonnées rendues. Une canonical pointant vers une autre page peut regrouper le contenu sous une URL différente.
Exposez un titre, une description et une image précis via Open Graph ou schema.org. Vérifiez og:title, og:description, og:image, le lien canonical et article:section ou le champ JSON-LD articleSection si les catégories sont utiles. Une image relative, protégée, expirée ou trop petite peut être inutilisable. La priorité exacte des métadonnées et les exemples restent dans le guide d’installation.
4. Contrôler les filtres et le délai#
Retrouvez l’article dans la source ou les données globales avant de diagnostiquer un robot. Vérifiez ensuite la source, le domaine, la langue, la date, l’URL, les termes inclus ou exclus, les tags et les catégories de la thématique. L’article peut être correctement collecté mais masqué par un seul filtre. Attendez l’intervalle de collecte ou de consultation configuré avant de relancer plusieurs rafraîchissements.
Si l’article apparaît dans la thématique mais qu’aucun post automatique n’existe, poursuivez avec Pourquoi mon robot n’a-t-il pas publié cet article ?.
5. Éléments à transmettre au support#
Envoyez l’URL finale exacte, l’heure UTC du test, le type de source (SDK, RSS, URL directe ou listening), le statut HTTP et les redirections, la canonical et les métadonnées rendues, la marque et la thématique concernées, puis la première étape où l’article disparaît. Retirez les identifiants de flux privés et ne transmettez jamais cookie de connexion, clé API ou jeton d’accès.