Données GA4 corrompues : détecter bots, spam fantôme et faux trafic direct avant de brancher l’IA
Ton modèle IA recommande d’augmenter le budget sur un segment qui convertit à 4,2%. Sauf que ce segment est rempli de bots. Félicitations : tu viens de construire une stratégie sur du vent.
C’est exactement le problème que personne ne règle avant de connecter un outil d’IA à ses données GA4. On parle de data quality depuis dix ans. On continue à l’ignorer au moment précis où ça coûte le plus cher.
Ce que GA4 filtre — et ce qu’il laisse passer
GA4 exclut par défaut les bots et spiders connus via la liste IAB/ABC International Spiders and Bots List. Ça semble rassurant. Ça ne l’est pas.
Ce filtrage natif est limité et ne couvre pas tous les types de trafic bot, notamment les sources de spam plus récentes. La limitation principale : GA4 ne peut filtrer le trafic que par adresse IP.
Les navigateurs headless, le referral spam, le trafic interne de QA et les crawlers IA passent tous à travers la liste IAB sans encombre — et chacun gonfle le nombre de sessions tout en dégradant les taux d’engagement et de conversion.
Trois types de pollution méritent une attention particulière.
Le trafic fantôme (ghost traffic) est un spoofing côté serveur qui envoie des hits Measurement Protocol directement dans GA4, sans aucun chargement de page ni interaction navigateur. Ces sessions peuvent contenir des données d’engagement entièrement fabriquées.
Le trafic direct gonfle lui aussi pour une raison différente : une partie peut provenir de sources organiques, sociales, email ou referral, mais tombe dans le canal direct parce que les données de provenance sont manquantes — un phénomène souvent appelé dark traffic.
Et le plus sournois : évite d’utiliser la fonctionnalité « List unwanted referrals » de GA4 pour filtrer le spam. Elle reclassifie le spam en trafic direct plutôt que de le bloquer. Tu déplaces le problème, tu ne le règles pas.
Les 5 signaux d’alerte à surveiller dans tes rapports
1. Sessions avec engagement nul. Un hit bot est une session. Il atterrit dans le dénominateur de chaque taux calculé sans jamais apparaître au numérateur. Résultat : sessions et pages vues augmentent, le taux d’engagement chute parce que les sessions bot durent moins d’une seconde et ne déclenchent aucun événement scroll, et le taux de conversion baisse parce que les conversions restent stables pendant que le dénominateur enfle.
2. Pics inexpliqués sur des pages profondes. Un volume élevé de sessions directes avec un temps d’engagement nul est un signal fort de bots ou crawlers. Vérifie aussi les landing pages concernées — si le trafic direct atterrit sur des URLs spécifiques qu’aucun vrai utilisateur ne taperait à la main, c’est un autre signal rouge.
3. Hostname inconnu. Le spam fantôme envoie des données directement aux serveurs Google sans qu’aucun utilisateur ne voie ta page. Contrôle via Engagement → Pages and Screens, en ajoutant « Host Name » comme dimension secondaire.
4. Trafic direct > 30% sans explication. Si ton trafic direct dépasse 30%, ne te précipite pas pour célébrer la notoriété de ta marque. GA4 a peut-être attribué des visites au trafic direct là où elles n’ont rien à y faire.
5. Spikes nocturnes ou géographiquement incohérents. Des pics de trafic direct à des heures inhabituelles — la nuit, en masse — peuvent indiquer du trafic bot ou une campagne marketing mal taguée.
GTM server-side : le seul endroit où tu contrôles vraiment
La réponse côté client est insuffisante. Avec le tracking server-side, les événements identifiés comme spam sont filtrés immédiatement avant d’être transmis à GA4.
Le GTM server-side filtre automatiquement une majorité du trafic bot par rapport au GTM client-side, grâce à la façon dont les requêtes sont traitées et au contrôle renforcé sur la validation des données côté serveur.
La stratégie optimale est en couches. Nettoie les rapports GA4 pour fiabiliser l’analyse, resserre les signaux de conversion GTM pour que le bidding n’apprenne pas du spam, et utilise le GTM server-side avec des contrôles edge pour stopper l’automatisation malveillante avant qu’elle n’atteigne tes points de conversion.
Un point critique souvent raté : les filtres de données GA4 affectent le traitement des données entrantes et ne réécrivent pas l’historique. Configure les filtres tôt pour que les rapports futurs restent propres.
Pourquoi un modèle IA entraîné sur ces données devient dangereux
C’est là que le problème change de nature. Les modèles de machine learning bénéficient particulièrement d’un nettoyage approfondi des données parce qu’ils apprennent de chaque point dans leur jeu d’entraînement. Lors de l’entraînement d’un modèle de prédiction de churn, des données corrompues peuvent créer de faux patterns que l’algorithme intègre dans sa logique de décision.
Un seul enregistrement avec un montant d’achat erroné ne fausse pas qu’un rapport trimestriel — il peut altérer fondamentalement l’entraînement du modèle, générant des prédictions systématiquement incorrectes sur des milliers de transactions futures. Cet effet d’amplification signifie que des problèmes de qualité de données simplement gênants en analytics traditionnel deviennent des défaillances critiques dans les applications IA.
Laissé sans filtre, le trafic bot ne déforme pas seulement tes rapports GA4 — il est transmis à Google Ads et Meta comme de vraies conversions, entraînant leurs algorithmes de bidding sur du trafic qui n’achètera jamais.
Prompt pour auditer tes données avant d’entraîner quoi que ce soit
Voici un prompt directement utilisable avec un LLM connecté à ton export BigQuery GA4 :
Tu es un expert en qualité de données analytics.
Analyse ce dataset GA4 exporté sur les 90 derniers jours.
Identifie :
1. Les sessions avec engaged_session_event_count = 0 et session_duration < 1s
2. Les hostnames qui ne correspondent pas à [mon-domaine.com]
3. Les sources/mediums avec un taux de conversion > 3x la médiane du dataset
4. Les pics de sessions sur des plages horaires 00h-05h (UTC)
5. Les landing pages avec > 500 sessions directes sur des URLs de profondeur > 3
Pour chaque anomalie détectée, indique le volume de sessions concernées,
l'impact estimé sur le taux d'engagement global, et une hypothèse de cause
(bot, misconfiguration, dark traffic).
Formate la réponse en tableau Markdown avec une colonne "priorité de correction".
« Ancienne école » vs méthode augmentée par IA
| Étape | Ancienne école | Avec IA |
|---|---|---|
| Détection | Regard manuel sur les rapports hebdomadaires | Alertes automatiques sur anomalies statistiques en temps réel |
| Filtrage | Exclusions IP fixes dans GA4 | Scoring comportemental dynamique côté serveur |
| Décision | « Ce pic semble bizarre » | Hypothèse documentée avec impact chiffré |
| Rétroaction | Jamais rétroactive | Alertes sur drift de distribution post-déploiement |
Les conséquences sont sérieuses : tests A/B brisés, métriques de trafic gonflées qui masquent un déclin réel, données d’engagement qui ne reflètent pas le comportement utilisateur réel. Quand ton équipe célèbre une croissance ou ajuste sa stratégie sur la base de sessions générées par des bots, tu optimises pour les mauvais signaux.
La prochaine fois que quelqu’un te propose de « brancher l’IA sur GA4 », pose une seule question avant d’accepter : est-ce que tu sais exactement ce que GA4 mesure en ce moment, et est-ce que tu peux le prouver ?
Catégories
