Vérifier la fiabilité de vos données : écarts, doublons et spam
Deux outils qui affichent exactement le même nombre devraient vous alerter davantage qu'un écart de quinze points expliqué et stable. Vérifier la fiabilité de vos données se joue sur trois fronts, les écarts entre sources, les événements comptés deux fois et le trafic parasite, et cette vérification constitue la partie la plus opératoire d'un audit de votre dispositif de tracking.
- Deux outils qui affichent exactement le même nombre doivent alerter davantage qu'un écart de quinze points expliqué et stable.
- Fixez la paire, la période et les définitions avant de regarder le moindre chiffre, et écrivez noir sur blanc le fuseau horaire de chaque outil.
- Le doublon le plus fréquent naît d'une migration vers Google Tag Manager : la balise historique reste dans le gabarit pendant que le conteneur envoie déjà les mêmes événements.
- La liste d'exclusion de référents n'a aucun effet rétroactif : une correction bien menée met plusieurs semaines à se voir dans les comparaisons annuelles.
- Un filtre de données actif produit un effet définitif : l'état test permet d'observer le volume concerné avant toute décision.
- Vérifier la fiabilité de vos données commence par comparer deux sources
- Repérer et traiter les événements comptés deux fois
- Neutraliser le spam référent et le trafic interne
- Installer un contrôle qualité récurrent
- Questions fréquentes
La méthode compte plus que l'outillage. Une équipe qui compare ses sources sans protocole fixe obtient un résultat différent à chaque tentative, ce que constatent tous les annonceurs avant de structurer leur mesure avec des experts du web analytics.
Vérifier la fiabilité de vos données commence par comparer deux sources
Fixez la paire, la période et les définitions avant de regarder le moindre chiffre. Trente jours glissants donnent une base plus lisible qu'un mois calendaire, à condition d'exclure les jours de mise en production, qui produisent des écarts ponctuels sans rapport avec l'état réel du dispositif.
Le fuseau horaire de chaque outil et la définition exacte de la conversion comparée méritent d'être écrits noir sur blanc. Une propriété réglée sur un fuseau et une régie réglée sur un autre décalent mécaniquement les chiffres de fin de journée, et l'équipe passe ensuite des réunions entières à chercher une cause technique qui n'existe pas.
Documenter cet écart revient à vérifier la fiabilité de vos données entre deux sources une fois pour toutes. Notez la valeur dans un document partagé, avec sa date et son explication. Le jour où elle double, vous saurez que le problème est apparu entre les deux mesures.

Repérer et traiter les événements comptés deux fois
Le cas le plus fréquent naît d'une migration vers Google Tag Manager. La balise historique reste dans le gabarit du site pendant que le conteneur envoie déjà les mêmes événements, si bien que chaque chargement de page part en double. Les symptômes se lisent sans outil : un volume de sessions qui saute d'un coup, un nombre de transactions inchangé côté commande, et un taux d'engagement qui se dégrade sans raison éditoriale.
La vérification demande quelques minutes. Ouvrez l'aperçu du conteneur et le mode de débogage de votre propriété, chargez une page de votre site, puis comptez les événements qui partent réellement. Deux vues de page pour un seul chargement, la démonstration est faite.
La correction se tranche en une fois. Une seule implémentation survit, et le retrait de l'autre se fait en une fois, avec un contrôle immédiat sur les mêmes parcours. Couper les deux le temps d'un arbitrage vous laisse sans mesure du tout pendant plusieurs jours.
Neutraliser le spam référent et le trafic interne
La liste d'exclusion de référents traite les domaines qui cassent artificiellement un parcours en deux visites, plateforme de paiement en tête. Google précise qu'ajouter un domaine à cette liste applique le paramètre ignore_referrer aux événements concernés, sans effet rétroactif sur les données déjà collectées. Vos rapports historiques garderont donc leur attribution d'origine, ce qui explique qu'une correction bien menée mette plusieurs semaines à se voir dans les comparaisons annuelles.
Le trafic interne relève d'un autre mécanisme, et il réclame de la prudence. Les filtres de données se créent manuellement et existent en trois états, test, actif ou inactif, l'état test permettant d'observer le volume concerné avant toute décision, sachant qu'un filtre actif produit un effet définitif sur les données. Activer directement un filtre trop large revient à effacer une part de votre mesure sans possibilité de retour. Le contrôle du trafic interne et des référents parasites passe donc systématiquement par une phase d'observation avant activation.
Installer un contrôle qualité récurrent
Un dispositif vérifié une fois se dégrade dès la mise en production suivante. La revue mensuelle se mène rapidement quand la grille existe : volume d'événements comparé au mois précédent, part de valeurs manquantes sur la source, événements clés qui se déclenchent toujours, écart de référence entre vos deux sources principales.
Le journal des changements du site fait le reste du travail, et il chiffre l'impact réel d'une erreur de marquage en jours de données perdues. Chaque mise en production notée avec sa date permet de rapprocher une anomalie d'un déploiement en quelques secondes, là où une enquête à l'aveugle occupe une équipe pendant des jours. Cette discipline de contrôle qualité se documente dans un plan de marquage tenu à jour, où chaque événement porte son propriétaire et sa date de dernière vérification.
Questions fréquentes
Une donnée dont vous connaissez les limites vaut mieux qu'une donnée que vous croyez parfaite. Nos consultants installent cette grille de contrôle avec vos équipes techniques, demandez votre audit. Les leviers qu'elle alimente sont pilotés par notre agence de marketing digital.
