Confidentialité

Un guide pratique de risques lies a la confidentialite des donnees

Taras Shynkarenko
Taras Shynkarenko
•Mis à jour : •9 min de lecture
Un guide pratique de risques lies a la confidentialite des donneesUn guide pratique de risques lies a la confidentialite des donnees

TL;DR, Réponse rapide

9 min de lecture

Les paramètres de rétention Google Analytics et le stockage de données basé aux États-Unis créent des risques de conformité GDPR que les organisations doivent gérer activement ou éviter complètement.

Facile à mal comprendre : la rétention GA4 ne touche que les rapports d'exploration et d'entonnoir, et laisse intacts la plupart des risques liés à la confidentialité des données.

La conservation des données Google Analytics est facile à mal comprendre. Dans GA4, les paramètres de conservation affectent les données au niveau de l'utilisateur et au niveau de l'événement utilisées dans les rapports d'exploration et d'entonnoir, et non dans les rapports agrégés standard. La documentation de Google répertorie 2 mois et 14 mois pour les propriétés standard, avec des options plus longues pour Google Analytics 360, et indique que les données sont automatiquement supprimées lorsqu'elles atteignent la fin de la période de conservation (GA4 data retention).

Ce paramètre n’est pas seulement pratique pour l’analyse. Il s'agit d'un contrôle de vie privée.

Pourquoi la rétention est importante sous GDPR

Le principe de limitation de la conservation du GDPR exige que les données personnelles soient conservées sous forme identifiable uniquement aussi longtemps que nécessaire à la finalité. Si les données brutes sur les événements sont conservées parce que « nous pourrions en avoir besoin un jour », le but est trop vague.

Les données analytiques peuvent inclure des données personnelles même lorsque les noms sont absents. Les données de l'appareil, les identifiants des cookies, les IDs utilisateur, le URLs complet, l'emplacement dérivé de IP, les paramètres d'événement et les séquences comportementales peuvent identifier ou distinguer une personne. Une conservation plus longue augmente l’impact des violations, les risques d’accès et l’exposition réglementaire.

Deux façons de justifier la rétention
Motif vague
  • Les données sont gardées parce qu'« on en aura peut-être besoin un jour »
  • Aucune échéance de suppression définie
  • Les données d'événements bruts restent identifiables indéfiniment
Principe de limitation de la conservation
  • Les données personnelles ne sont conservées que le temps nécessaire à leur finalité
  • La durée de rétention est liée à un usage défini
  • La suppression suit dès que la finalité prend fin
Le principe de limitation de la conservation du GDPR sépare une habitude d'une politique.

Ce que la rétention GA4 résout et ne résout pas

Les contrôles de rétention GA4 peuvent réduire la durée pendant laquelle les données au niveau des événements restent disponibles pour certaines fonctionnalités d'analyse. Mais ils ne répondent pas à toutes les questions relatives à la vie privée :

  • Les rapports agrégés standards ne sont pas affectés de la même manière.
  • L'exportation BigQuery crée un ensemble de données distinct sous votre contrôle.
  • Les produits liés peuvent avoir leur propre comportement de rétention.
  • Les rapports téléchargés et les copies d'entrepôt nécessitent leur propre politique.
  • Les questions de consentement et de transfert nécessitent encore une analyse distincte.

Si vous exportez des données GA4 vers BigQuery, Google indique que vous êtes propriétaire de ces données exportées et que vous gérez l'accès via les contrôles BigQuery (GA4 BigQuery export). Cela signifie que la responsabilité de la conservation vous incombe.

Modèles de rétention risqués

Les problèmes courants incluent :

  • Quitter la conservation par défaut sans comprendre les besoins en matière de reporting.
  • Exportation de données brutes vers un entrepôt sans calendrier de suppression.
  • Conserver les identifiants des utilisateurs dans les analyses après la suppression du compte.
  • Stockage des URLs pleine page contenant des e-mails, des jetons ou des termes de recherche.
  • Donner au large personnel un accès aux données au niveau des événements.
  • Conservation des données à des fins publicitaires après la désinscription des utilisateurs.

Des boîtes d'archives étiquetées sur une étagère, illustrant comment les données peuvent être triées en niveaux de rétention à court et long terme.

Un meilleur modèle de rétention

Utiliser des niveaux :

Temps réel et débogage : heures à jours. Utile pour les contrôles de déploiement et les enquêtes sur les incidents.

Analyse des événements bruts : 30 à 180 jours, selon les cycles du produit et la base légale.

Rapports agrégés : 12 à 36 mois pour l'analyse des tendances, sans identifiants personnels.

Documents financiers ou contractuels : distincts des analyses Web et conservés dans le cadre d'obligations comptables ou légales.

Documentez l’objectif de chaque niveau et automatisez la suppression. Les politiques de suppression manuelle échouent discrètement.

Flowsery
Flowsery

Essai gratuit

Tableau de bord en temps réel

Suivi des objectifs

Suivi sans cookies

Avantage analytique axé sur la vie privée

Une plate-forme d'analyse axée sur la vie privée qui évite les cookies, les IDs persistants, les empreintes digitales et le stockage brut IP réduit le risque de rétention dès le début. Les mesures agrégées peuvent souvent être conservées plus longtemps car elles sont moins susceptibles d’identifier des individus. Les événements bruts peuvent être de courte durée ou complètement évités.

Le but n’est pas de supprimer l’historique utile. Il s'agit de conserver la forme d'historique la plus utile : tendances, conversions, campagnes et performances du contenu sans traces personnelles inutiles.

Liste de contrôle

  1. Vérifiez les paramètres de rétention GA4.
  2. Identifiez toutes les exportations et produits connectés.
  3. Définissez la conservation des événements bruts, des rapports et des tables d'entrepôt.
  4. Supprimez les données personnelles des paramètres de l'événement.
  5. Restreindre l’accès aux données au niveau des événements.
  6. Workflows de suppression de documents pour les demandes des utilisateurs.
  7. Examinez la rétention après des modifications majeures du produit ou des lois.

C’est dans la rétention que les promesses en matière de vie privée deviennent réelles. Si vous ne parvenez pas à expliquer pourquoi un ensemble de données existe toujours, il est probablement temps de l'agréger ou de le supprimer.

Rétention des propriétés d'événement

L'examen de la rétention doit inclure les propriétés des événements, et pas seulement les horodatages des événements. Une propriété telle que search_term, account_id, page_location ou checkout_step peut comporter plus de risques en matière de vie privée que le nom de l'événement. Si vous avez besoin d'analyses de recherche, envisagez de regrouper les requêtes, de supprimer les requêtes rares ou de revoir les termes du contenu sensible avant de les stocker.

Une personne badgeant pour ouvrir une porte de bureau verrouillée, représentant l'accès restreint aux données brutes d'analytics.

Contrôles d'accès

Une conservation courte n’aide pas si trop de personnes peuvent exporter des données alors qu’elles existent. Limitez l’accès aux analyses brutes aux personnes qui en ont besoin, préférez les tableaux de bord agrégés pour la plupart des parties prenantes et enregistrez les exportations à partir des entrepôts de données. Les données analytiques semblent souvent à faible risque jusqu'à ce qu'elles soient combinées avec des données CRM, de facturation ou d'assistance. Les politiques d’accès doivent supposer que les jointures peuvent augmenter la sensibilité.

Modèle de politique de rétention

Rédigez la politique dans un langage commercial. Les événements d’analyse brute sont conservés pendant une courte fenêtre de diagnostic. Les rapports agrégés sont conservés plus longtemps pour l'analyse des tendances. Les propriétés des événements sensibles sont bloquées ou expurgées avant le stockage. Les exportations nécessitent un objectif nommé et expirent. Les paramètres de fidélisation des fournisseurs sont examinés après le lancement de produits, les modifications de campagne et les transferts d'agence. La documentation GA4 de Google sur la conservation des données montre que les paramètres de conservation affectent différemment les données au niveau de l'utilisateur et au niveau de l'événement. Les équipes ne doivent donc pas supposer qu'une seule option résout tous les risques.

Pour une configuration axée sur la vie privée, séparez trois couches. Premièrement, les événements opérationnels en temps réel utilisés pour vérifier le suivi. Deuxièmement, les événements bruts récents utilisés pour déboguer les formulaires, les campagnes et les entonnoirs. Troisièmement, regroupez les mesures historiques utilisées pour la stratégie. La plupart des équipes ont besoin de la troisième couche beaucoup plus longtemps que les deux premières. Cette conception conserve un historique utile tout en réduisant le risque que d'anciens identifiants, URLs, termes de recherche ou données personnelles accidentelles restent disponibles des années après l'expiration de l'objectif initial.

Trois couches de données d'analytics
Événements opérationnels en temps réel
Événements bruts récents
Métriques historiques agrégées
La plupart des équipes ont besoin de la troisième couche bien plus longtemps que des deux premières.

Actions d’audit de rétention

Créez un inventaire de rétention pour GA4 et chaque destination connectée. Enregistrez si la mesure améliorée, les signaux Google, la personnalisation des annonces, l'exportation User-ID, BigQuery, Consent Mode, la mesure inter-domaines et les paramètres spécifiques à la région sont activés.

Séparez ensuite ce qui doit rester brut de ce qui peut devenir une histoire globale. Conservez les données GA4 uniquement lorsque l'écosystème de reporting ou d'annonces de Google a un rôle justifié ; déplacez les pages de référence, les référents, les campagnes, les objectifs et les entonnoirs agrégés vers une configuration à moindre risque lorsque cela est possible.

Questions fréquentes

Que contrôle vraiment le paramètre de rétention de GA4 ?

Le paramètre de rétention de GA4 régit les données au niveau utilisateur et au niveau événement utilisées dans les explorations et les rapports d'entonnoir, pas les rapports agrégés standard. Les propriétés standard proposent 2 ou 14 mois, avec des options plus longues sur Google Analytics 360. Google supprime les données automatiquement une fois la fin de la période choisie atteinte.

Pourquoi raccourcir la rétention GA4 ne suffit-il pas à lui seul ?

L'export vers BigQuery crée un jeu de données distinct qui reste sous votre propre contrôle, donc raccourcir la rétention GA4 ne change rien à cette copie. Les rapports téléchargés et les produits liés peuvent avoir leur propre comportement de rétention. Chacune de ces copies a besoin de sa propre politique de suppression.

À qui appartiennent les données GA4 exportées vers BigQuery ?

La documentation de Google indique elle-même que vous êtes propriétaire des données exportées et que vous gérez l'accès via les contrôles BigQuery. La responsabilité de la rétention se déplace donc vers votre équipe plutôt que vers l'infrastructure de Google. Le calendrier de suppression de cette copie dans l'entrepôt doit être construit séparément des paramètres GA4.

Les données d'analytics peuvent-elles être des données personnelles sans nom associé ?

Les données d'appareil, les identifiants de cookies, les ID utilisateur, les URL complètes, la localisation dérivée de l'IP, les paramètres d'événement et les séquences comportementales peuvent à eux seuls identifier ou isoler une personne. Aucun d'entre eux n'a besoin d'un nom attaché pour porter ce risque. Une rétention plus longue ne fait que multiplier l'exposition si l'une de ces données fuit.

Combien de temps faut-il garder les données d'événements bruts ?

Le modèle par paliers de l'article situe l'analyse d'événements bruts entre 30 et 180 jours, selon le cycle produit et la base légale. Les données temps réel et de débogage n'ont besoin que d'heures à quelques jours. Les rapports agrégés, sans identifiants personnels, peuvent tenir de 12 à 36 mois.

Flowsery
Flowsery

Essai gratuit

Tableau de bord en temps réel

Suivi des objectifs

Suivi sans cookies

Quelles propriétés d'événement présentent le plus de risque pour la vie privée ?

Des propriétés comme search_term, account_id, page_location ou checkout_step portent souvent plus de risque que le nom de l'événement lui-même. L'analyse des recherches est un piège fréquent. Regrouper les requêtes, écarter les plus rares ou vérifier les termes sensibles avant stockage réduit ce risque.

Pourquoi limiter l'accès aux données brutes compte-t-il même quand la rétention est déjà courte ?

Une rétention courte n'aide pas beaucoup si trop de personnes peuvent exporter les données pendant qu'elles existent encore. Le plus sûr est de réserver l'accès aux données brutes à ceux qui en ont réellement besoin et de donner aux autres parties prenantes des tableaux de bord agrégés. Les exports depuis les entrepôts de données devraient aussi être journalisés.

Pourquoi combiner l'analytics avec des données CRM ou de facturation augmente-t-il le risque ?

Les données d'analytics semblent souvent peu risquées isolément, jusqu'à ce qu'elles soient combinées avec des données CRM, de facturation ou de support. Cette combinaison peut transformer une simple vue de page en donnée qui identifie un client précis. Les politiques d'accès devraient partir du principe que ces croisements sont possibles et être conçues en conséquence.

Que doit consigner un audit de rétention ?

Un inventaire de rétention doit couvrir GA4 et chaque destination connectée, en notant si enhanced measurement, Google Signals, la personnalisation des annonces, User-ID, l'export BigQuery, Consent Mode, la mesure inter-domaines et les paramètres régionaux sont activés. À partir de là, il faut séparer ce qui doit rester brut de ce qui peut passer en historique agrégé. Les pages de base, les référents, les campagnes, les objectifs et les entonnoirs agrégés peuvent souvent basculer vers une configuration moins risquée.

Une plateforme d'analytics axée sur la vie privée change-t-elle le calcul de rétention ?

Une plateforme qui évite les cookies, les ID persistants, le fingerprinting et le stockage d'IP brutes réduit le risque de rétention dès le départ. Ses métriques agrégées peuvent souvent être conservées plus longtemps car elles risquent moins d'identifier une personne. Dans ce modèle, les événements bruts peuvent rester éphémères ou être évités entièrement.

Cet article vous a-t-il été utile ?

Dites-nous ce que vous en pensez !

Nous voir plus souvent sur Google

Un clic définit Flowsery comme source préférée. Nos articles remontent alors dans vos À la une, en mode IA et dans les aperçus IA.

Avant de partir...

Flowsery

Flowsery

Des analyses orientées revenus pour votre site web

Suivez chaque visiteur, source et conversion en temps réel. Simple, puissant et sans cookies.

Tableau de bord en temps réel

Suivi des objectifs

Suivi sans cookies

Articles connexes