← Retour aux études de cas

Du goulot d’étranglement du contenu à un moteur de productivité : comment atronous a donné un coup d’accélérateur à un distributeur international

Du goulot d’étranglement du contenu produit à une productivité automatisée

Sur un marché mondial qui évolue à toute vitesse, un contenu produit de qualité est vital pour les achats en ligne et pour l’efficacité commerciale. Il informe les clients, instaure la confiance et, au bout du compte, déclenche les conversions. Mais que se passe-t-il lorsque la source même de ce contenu essentiel devient un obstacle majeur ?

C’est précisément le défi auquel un grand distributeur international a été confronté récemment. Son catalogue comptait des milliers de SKU, qui exigeaient chacun des descriptions détaillées, des visuels convaincants et une documentation indispensable. Le problème : une grande partie de ces informations était enfouie dans des fiches techniques complexes et des manuels PDF, sur le site web du fabricant.

Imaginez l’ampleur du travail manuel. Le plan initial du distributeur avait de quoi décourager : embaucher du personnel dédié pour parcourir minutieusement le site du fabricant, copier-coller les informations produit, télécharger les images et les PDF, puis tout saisir à la main dans un fichier Excel. Pour plus de 2 000 produits ! Cette approche n’était pas seulement chronophage et source d’erreurs : elle mobilisait aussi beaucoup de ressources et constituait un goulot d’étranglement majeur dans sa stratégie de mise sur le marché.

Entrée en scène d’atronous : transformer les obstacles en opportunités

Conscient de l’inefficacité de ce processus manuel et des problèmes de passage à l’échelle qui lui étaient inhérents, le distributeur s’est tourné vers atronous pour trouver une solution plus intelligente. Notre équipe est spécialisée dans la simplification de la gestion du contenu produit, et nous étions impatients de nous attaquer de front à ce défi.

Voici comment atronous a aidé ce distributeur international à sortir de son goulot d’étranglement du contenu et à réaliser d’importants gains de productivité :

1. Extraction et analyse intelligentes des données web

Plutôt qu’une exploration générique du site, nous avons employé des techniques d’ingestion web ciblées, reposant sur des bibliothèques et des frameworks optimisés pour naviguer dans des structures de sites complexes et en extraire les données. Cela impliquait :

  • Compréhension du contenu sémantique de la page : nous avons utilisé des modèles de vision par ordinateur capables d’interpréter le contenu de la page pour en extraire les informations pertinentes, comme les codes UPC, les références fabricant et d’autres attributs.
  • Sélecteurs de contenu en solution de repli : nous avons utilisé les outils de développement du navigateur et des techniques comme les sélecteurs XPath et CSS pour cibler précisément les éléments HTML contenant les titres des produits, les descriptions, les URL des images, les liens vers les PDF et les tableaux d’attributs.
  • Gestion fiable des erreurs : nous avons mis en place des mécanismes capables de gérer proprement les modifications du site, les liens rompus et les structures de données incohérentes, afin de limiter les interruptions et de garantir l’intégrité des données.
  • Analyse et structuration des données : une fois extraites, les données HTML brutes étaient analysées et structurées dans un format exploitable. Cela impliquait :
    • Extraction et nettoyage du texte : supprimer les balises HTML, les scripts et les styles inutiles pour se concentrer sur les informations produit essentielles. Appliquer des méthodes de nettoyage du texte pour corriger les incohérences de mise en forme, les problèmes d’espacement et les caractères spéciaux.
    • Identification et extraction des attributs : développer une logique pour identifier et extraire les attributs produit clés, souvent présentés sous forme de tableaux ou de listes structurées. Cela impliquait la reconnaissance de motifs et la normalisation des données, pour garantir la cohérence d’une page produit à l’autre.

2. Analyse des données et des images contenues dans les fichiers PDF

Lorsque le site du fabricant hébergeait des manuels produit ou des spécifications sous forme de fichiers PDF, notre processus d’ingestion était étendu à des techniques spécialisées d’analyse des PDF. Voici le détail des approches techniques mises en œuvre :

  • Identification des liens et téléchargement : notre moteur d’ingestion web repérait les liens vers des fichiers PDF sur le site du fabricant, généralement dans les pages produit ou dans des rubriques consacrées aux ressources. Ces liens étaient extraits, puis les fichiers PDF correspondants étaient téléchargés et stockés de façon sécurisée, dans leurs propres emplacements cloud.
  • Extraction du contenu des PDF, choix des bonnes bibliothèques et des bons outils : selon la complexité et la structure des PDF, atronous a utilisé diverses bibliothèques et divers outils, open source et commerciaux, spécialement conçus pour le traitement des PDF dans des langages comme Python. Pour en savoir plus sur cette étape, consultez cet article technique.
  • Extraction des données de tableaux :
    • Détection heuristique des tableaux : des algorithmes analysent la mise en page du PDF pour repérer les structures de tableau potentielles, à partir de la présence de lignes, d’espacements et de motifs répétés.
    • Extraction des données structurées : une fois un tableau identifié, des techniques d’analyse plus poussées permettent d’extraire les données de ses lignes et de ses colonnes, ce qui impose souvent de gérer des cellules fusionnées et des mises en page de tableau complexes.
    • Conversion en formats structurés : les données extraites des tableaux sont ensuite généralement converties en formats structurés, comme des listes de dictionnaires ou des structures de type CSV, pour faciliter le mapping et l’intégration.

3. Transformation automatisée des données et mapping vers les modèles

Normalisation et nettoyage des données

  • Avant d’être mises en correspondance avec les modèles du distributeur, les données extraites passaient par un processus de normalisation et de nettoyage. Celui-ci comprenait :
    • Conversion des types de données : s’assurer que les champs correspondaient aux types de données attendus dans les modèles cibles (par exemple, convertir des nombres stockés sous forme de texte en formats numériques).
    • Standardisation des unités de mesure : si nécessaire, standardiser les unités de mesure (par exemple, convertir des pouces en centimètres).
    • Validation des données : mettre en place des règles pour repérer et signaler les données potentiellement erronées ou manquantes, selon des critères prédéfinis.

Moteur de mapping des modèles

  • Nous avons développé un moteur de mapping flexible qui nous permettait de relier les champs de données extraits et normalisés aux colonnes et aux structures propres aux modèles d’import du distributeur (vraisemblablement dans des formats comme CSV ou Excel). Cela impliquait :
    • Règles de mapping configurables : fournir une interface ou des fichiers de configuration pour définir les correspondances entre les champs des données sources et les champs du modèle cible.
    • Logique de dérivation des données : implémenter une logique sur mesure dans le moteur de mapping pour dériver des champs plus complexes si nécessaire (par exemple, combiner plusieurs champs sources en un seul champ cible).
    • Traitement par lots et automatisation : automatiser l’application des règles de mapping aux données extraites, par lots, pour générer des fichiers de sortie correctement formatés, prêts à être importés dans les systèmes du distributeur (par exemple, PIM, ERP, plateforme e-commerce).

4. Intégration de la traduction multilingue

  • Services de traduction pilotés par API : pour traduire les titres et les descriptions des produits en espagnol et en français, nous avons intégré des API de traduction cloud reconnues (par exemple, Google Translate API, Amazon Translate).
  • Workflow de traduction automatisé : les titres et les descriptions extraits étaient envoyés automatiquement à l’API de traduction choisie. Le texte traduit était ensuite récupéré et réintégré dans les données traitées.
  • Points d’attention sur la qualité : même si le processus était entièrement automatisé, nous recommandions et mettions souvent en place des options de relecture humaine des traductions, en particulier pour les textes marketing critiques, afin de garantir leur exactitude et leur pertinence culturelle.

Pipeline de traitement des données et de mapping vers les modèles en six étapes : normalisation, conversion des types de données, standardisation des unités, validation, développement du moteur de mapping et règles de mapping configurables

Bénéfices techniques et impact

Grâce à ces capacités techniques, atronous a fourni une solution qui présentait les qualités suivantes :

  • Évolutive : elle pouvait traiter de grands volumes de données produit et s’adapter à la croissance future du catalogue.
  • Efficace : elle automatisait l’acquisition et la préparation des données, ce qui réduisait nettement l’effort manuel et le temps nécessaire.
  • Précise : elle réduisait au minimum le risque d’erreur humaine lié à la saisie manuelle des données.
  • Intégrée : elle s’insérait sans difficulté dans les systèmes et les workflows existants du distributeur, grâce à des fichiers de sortie conformes à ses modèles.
  • Prête pour l’international : nos capacités de traduction automatisée ont préparé le terrain pour une expansion vers de nouveaux marchés.

Conclusion

Le gain de productivité de 80 % n’était pas qu’un chiffre accrocheur : c’était le résultat tangible d’une infrastructure technique puissante et automatisée. En remplaçant un processus manuel et gourmand en ressources par un système de création de catalogue efficace et évolutif, le distributeur a libéré ses équipes des tâches ingrates, et celles-ci ont pu se concentrer sur des tâches à forte valeur ajoutée, comme l’approbation du contenu.

Transformez des données produit défaillantes en fiches vérifiées.

Commencez par une conversation sur vos données produit.