Mesurer la qualité des données produit : la septième dimension

La responsabilité des données produit se répartit entre de nombreuses fonctions au sein d’une entreprise, mais la consigne est toujours la même : « De meilleures données produit. » C’est facile à dire, mais difficile à traduire en actions concrètes, car on ne peut pas améliorer ce que l’on ne mesure pas. La plupart des équipes soit ne mesurent pas du tout la qualité de leurs données produit, soit n’en ont qu’une vue partielle.
La qualité des données produit désigne la mesure dans laquelle une fiche produit est complète, valide, cohérente et exacte pour sa catégorie, de sorte que chaque canal l’accepte et que chaque système ou acheteur qui la lit, humain ou IA, puisse s’y fier. Dans le contexte actuel, cela ne suffit pas. Pour offrir un contenu de haute qualité, un produit doit comporter des données non seulement exactes, mais aussi pertinentes.
La plupart des équipes n’en arrivent jamais là. Elles savent que leurs données doivent être retravaillées. Elles ressentent le poids des reprises et des mises en ligne refusées, mais le processus peut ressembler à une boîte noire. Si vous ne mesurez pas les bons éléments, chaque projet de données repose sur l’intuition, et l’intuition ne passe pas à l’échelle de centaines de milliers de SKU répartis dans des centaines de catégories.
Ce que les équipes mesurent le plus souvent, quand elles mesurent quelque chose, c’est le taux de remplissage, c’est-à-dire le pourcentage de champs non vides. Il ne raconte qu’une infime partie de l’histoire et ne dit rien de la qualité. Il est facile à calculer et donne une impression de progrès. Malheureusement, c’est aussi l’indicateur le plus susceptible de vous dire que vos données vont bien, jusqu’au moment où une place de marché en refuse la moitié. Et même si la fiche est mise en ligne, il y a de fortes chances qu’elle ne soit pas trouvée. Bien mesurer la qualité des données produit demande quelques dimensions de plus. Nous pouvons emprunter la plupart d’entre elles aux référentiels génériques de qualité des données, mais il existe aussi une dimension propre au produit, essentielle pour activer avec succès votre catalogue sur tous les canaux.
Les six premières dimensions
La qualité des données, au sens générique, dispose d’un vocabulaire standard, et l’essentiel s’applique aussi aux données produit. Chaque dimension s’accompagne d’un indicateur que vous pouvez réellement calculer.
- Complétude. La part des attributs obligatoires qui sont renseignés.
- Validité. La part des valeurs conformes au format et au type qu’exige leur champ. Un UPC qui ne passe pas le contrôle de sa clé est invalide. Un poids indiqué comme « moyen » est généralement invalide. C’est sur les identifiants (UPC, EAN, GTIN, etc.) que la mesure de la validité a le plus de valeur, car un identifiant invalide signifie une mise en ligne refusée.
- Cohérence. La part des fiches dont les champs ne se contredisent pas. Un titre qui annonce de l’acier inoxydable, à côté d’un attribut matériau qui indique de l’aluminium, constitue un défaut de cohérence, même si les deux champs sont renseignés et que chacun, pris isolément, est bien formé.
- Unicité. Le taux de doublons involontaires. Deux fiches pour un même produit, ou un même identifiant réutilisé pour deux produits, faussent tout ce qui se trouve en aval, des stocks aux recommandations.
- Exactitude. Le fait qu’une valeur soit réellement vraie pour le produit. Elle est difficile à mesurer, car elle exige généralement une source de vérité à laquelle se comparer, et c’est là que les règles de catégorie deviennent essentielles.
- Fraîcheur. Le fait que la fiche reflète l’état actuel du produit (son prix, sa disponibilité, ses spécifications) au moment où un canal la lit.
Si vous mesurez ne serait-ce que ces six dimensions, vous avez déjà une longueur d’avance sur la plupart des équipes. Il y a pourtant davantage à prendre en compte, et la pertinence d’un attribut pour une recherche ou une décision d’achat (et pas seulement sa complétude ou son exactitude) complique encore les choses.
La dimension qu’oublient les référentiels : la pertinence
Une fiche peut être complète, valide, cohérente, unique, exacte et à jour, et pourtant échouer au seul test qui compte au moment de la vente. Rien de tout cela ne compte si l’acheteur n’y trouve pas ce qu’il est venu chercher.
Nous en arrivons ainsi à la septième dimension, et c’est la dimension décisive : la pertinence. Elle pose une question d’une autre nature que les six autres. Les autres demandent si la donnée est correcte. La pertinence demande si quelqu’un s’en soucie. Cet attribut, ce fait, cette formulation répondent-ils à ce qu’un acheteur (humain ou IA) cherche réellement à trancher ?
Prenons un legging. Une fiche parfaitement exacte peut indiquer la composition, les instructions d’entretien et le pays d’origine. La page produit peut être parfaitement valide, cohérente et exacte, sans jamais mentionner que le legging est taille haute, qu’il a des poches ou qu’il garde sa forme pendant un squat. L’acheteur ne cherche pas « 82 % polyamide ». Il cherche les bénéfices qui comptent pour lui. Voici un exemple de fiche produit bien construite :

Elle précise bien que le legging est taille haute et qu’il a des poches. Mais le contenu pourrait aller encore plus loin. Quelle est la taille des poches ? Pourriez-vous y glisser votre téléphone ? Quelle est la proportion de polyester et d’élasthanne, pour que l’acheteur se fasse une idée de l’élasticité ? Pouvez-vous le passer au sèche-linge ?
Même un produit qui satisfait toutes les définitions standard d’une fiche complète peut manquer des données pertinentes nécessaires pour être trouvé ou correctement indexé par les agents IA. Cela tient au fait que la pertinence est absente des référentiels standard de qualité des données. Ces référentiels ont été conçus pour juger la donnée par rapport à elle-même (son format, sa logique interne, sa source de vérité), et tous ces éléments sont définis à l’intérieur de votre propre système. La pertinence, elle, est définie en dehors de ces systèmes, par l’acheteur, et c’est la seule dimension que vous ne pouvez pas certifier en regardant uniquement votre propre catalogue. Une valeur n’est pertinente que par son utilité pour un consommateur.
Ce que veulent les acheteurs et la façon dont ils achètent forment une cible en perpétuel mouvement. Les attributs qui ont décidé d’un achat la saison dernière ne sont pas ceux qui le décident cette saison. De nouveaux cas d’usage apparaissent, de nouvelles comparaisons deviennent le critère qui départage, le vocabulaire de recherche évolue avec le temps, et les assistants IA se mettent à demander des informations qu’aucun modèle n’avait prévues. Une fiche parfaitement pertinente au lancement peut vite devenir obsolète, non pas parce que la moindre valeur a changé, mais parce que le comportement du consommateur (ou de l’agent) a changé autour d’elle. La pertinence est la seule dimension qui se dégrade alors que vos données restent parfaitement immobiles. C’est ce qui la rend difficile, et c’est pourquoi la pertinence ne peut pas être un projet que l’on mène à son terme. Elle doit être entretenue et optimisée en continu.
C’est pourquoi la mesure doit s’inscrire dans un pipeline, et non dans un audit. Le pipeline de données d’atronous optimise en continu. Chaque fiche est contrôlée pour l’intégrité de ses identifiants, avec un taux de réussite de 100 % au contrôle du format et de la clé, et zéro doublon parmi les identifiants livrés. Chaque attribut est validé selon le vocabulaire de contraintes propre à sa catégorie, sur plus de 400 catégories, chaque vocabulaire étant appliqué indépendamment. La complétude est notée au regard de ce qu’exige la catégorie, et non de ce que demande un modèle. Et le contenu peut être noté et optimisé en fonction de ce que les acheteurs et les agents IA recherchent réellement. Le pipeline maintient le contenu à jour à mesure que cette demande évolue. Une livraison type pour un grand compte fait ressortir 18 catégories distinctes d’anomalies de qualité des données et renvoie chacune avec sa justification, avec un taux de succès de 98 % ou plus. Rien n’est écarté en silence.
Pourquoi la pertinence vaut l’effort
Bien mesurer la qualité des données produit demande plus de travail que de lire un taux de remplissage sur un tableau de bord. La maintenir pertinente en demande encore davantage, car ce travail n’est jamais tout à fait terminé. Cela en vaut la peine, pour trois raisons.
- Une mesure rigoureuse vous indique où vous en êtes réellement, fiche par fiche et catégorie par catégorie, pour qu’un projet de données soit ciblé plutôt que fondé sur des suppositions.
- Elle prédit les résultats qui comptent pour vous, car les chiffres qui la font évoluer (la complétude exigée par la catégorie et la pertinence) sont ceux-là mêmes qui déterminent si un produit est trouvé, rapproché de l’intention de l’acheteur, puis acheté.
- Elle devient ce qui sépare un produit trouvé d’un produit ignoré. Le lecteur d’une fiche produit est de plus en plus souvent un agent IA qui ne parcourt pas de page. Il lit des données structurées, compare sur cette base et décide en une phrase si votre produit répond à la question. Un attribut qui compte pour l’acheteur et qui manque n’est pas un simple champ vide. C’est une raison de recommander quelqu’un d’autre. Et comme ce que demande l’agent ne cesse de changer, la pertinence ne se règle jamais une fois pour toutes. Elle s’entretient.
L’exactitude et la complétude sont le minimum requis, et elles ne suffisent pas à elles seules. Une fiche peut être à la fois exacte et complète, et répondre malgré tout à une question que personne ne pose. Ce qui distingue un contenu de qualité d’un contenu simplement correct, c’est qu’il apporte ce que l’acheteur veut savoir, ici et maintenant, dans les mots qu’il emploie pour le demander. Comme cette cible ne cesse jamais de bouger, la seule façon de garder une longueur d’avance est de s’appuyer sur un pipeline qui maintient chaque fiche à jour, pertinente et optimisée, pour les acheteurs humains comme pour les agents IA, chaque fois que la question change.
Faites mesurer vos propres données
Le moyen le plus rapide de savoir où en sont vos données produit est d’en faire mesurer un échantillon, qui vous est ensuite renvoyé. C’est ce que fait l’évaluation de la qualité des données d’atronous. Envoyez jusqu’à 50 SKU extraits de votre PIM ou de votre ERP, exactement tels qu’ils vivent dans votre système, et nous les faisons passer par le même pipeline que celui sur lequel s’appuient nos clients grands comptes. Sous cinq jours ouvrés, vous recevez votre échantillon généré et validé, avec les recommandations de taxonomie et de schéma qui expliquent le travail, et une session de travail avec un spécialiste pour passer en revue ce que nous avons trouvé, ce que nous avons ajouté et ce que cela signifie à l’échelle de votre catalogue.
L’évaluation s’appuie sur vos propres fiches pour montrer précisément où vos données doivent être améliorées, et à quoi ressemblent, concrètement, de meilleures données.
Demandez votre évaluation de la qualité des données.
L’intelligence dans chaque attribut.
Questions fréquentes
Qu’est-ce que la qualité des données produit ?
La qualité des données produit désigne la mesure dans laquelle une fiche produit est complète, valide, cohérente et exacte pour sa catégorie, de sorte que chaque canal l’accepte et que chaque système ou acheteur qui la lit, humain ou IA, puisse s’y fier. Il ne suffit pas qu’elle soit correcte : une fiche de haute qualité contient aussi les données pertinentes pour ce que les acheteurs et les agents IA cherchent réellement à trancher.
Comment mesurer la qualité des données produit ?
Selon sept dimensions. Six sont reprises des référentiels génériques de qualité des données, chacune avec un indicateur calculable : la complétude, la validité, la cohérence, l’unicité, l’exactitude et la fraîcheur. La septième, la pertinence, consiste à se demander si la fiche répond à ce qu’un acheteur ou un agent IA cherche réellement à trancher. Comme cette cible ne cesse de bouger, la pertinence doit être mesurée en continu dans un pipeline, et non une seule fois lors d’un audit.