Aller au contenu

Pour les éditeurs

Le crawler C Wire

Nous achetons uniquement des pages que nous avons lues. Si notre crawler ne peut pas accéder à vos pages, nous ne pouvons pas les lire. Le bloquer retire donc votre inventaire de nos plans au lieu de le protéger.

01Ce que voit le robot

CWireBotlit la pagecartographie chaque emplacementconsigne dans le Placement Graph

02Agent utilisateur

Agent utilisateur

CWireBot
La requête dit qui elle est et ce qu'elle accepte. La vérification se lit dans les logs, pas dans la promesse.

03Cadence d'exploration

Une requête par seconde et par hôte par défaut, moins sur demande. Nous respectons Retry-After et ralentissons sur tout 429 ou 5xx.

Une requête par seconde au plus. Une page occupée gagne une heure plus calme.

04Ce que fait le crawler

Il lit et vectorise le texte des articles pour établir le sujet du contenu et note où se situent les emplacements publicitaires dans la maquette. Il ne collecte aucune donnée personnelle et ne suit ni formulaire ni espace connecté.

Content Graph

Ce que dit chaque page ou vidéo après que nous l’avons lue et vectorisée.

Placement Graph

Ce que chaque emplacement audité a délivré, consigné unité par unité.

Tous deux alimentent chaque décision.

05Instructions d'autorisation

Rien ne change, sinon ceci : nos requêtes ne sont plus refusées, et la page commence à être lue.

Security · WAF · Custom rules. Create a rule with the Skip action.

(http.user_agent contains "CWireBot")
→ Action: Skip
→ Skip: All remaining custom rules, Bot Fight Mode, Rate limiting

Questions

Le crawler expliqué

Pourquoi C Wire doit-il crawler mon site ?

Parce que C Wire achète uniquement les pages qu'elle a lues. Si le crawler ne peut pas accéder à vos pages, elles ne peuvent pas être lues. Le bloquer retire donc votre inventaire de tous les plans au lieu de le protéger.

Que lit et enregistre le crawler ?

Le texte de l'article, pour comprendre le sujet du contenu, ainsi que l'emplacement des blocs publicitaires dans la mise en page. Il ne collecte aucune donnée personnelle et ne suit jamais les formulaires ni les espaces connectés.

Quelle charge génère-t-il ?

Une requête par seconde et par hôte par défaut, moins sur demande. Il respecte l'en-tête Retry-After et réduit sa cadence en cas de réponse 429 ou 5xx.

Comment l'ajouter à la liste autorisée ?

Via le user agent et les plages IP publiés, par plage plutôt que par adresse unique. Les instructions détaillées pour Cloudflare, Akamai, Fastly, AWS WAF et robots.txt figurent sur cette page, en accès libre sans formulaire.

06Demander l'exploration de votre site

Envoyez le domaine, nous confirmons la fenêtre d'exploration. Aucune instruction ci-dessus n'est derrière un formulaire.

Étape suivante

Parlons intégration.

Un tag, aucune refonte, et une revue de la place de nos formats dans votre maquette. Ou commencez simplement par autoriser le crawler.