← Volver a los casos de éxito

De cuello de botella de contenido a motor de productividad: cómo atronous impulsó a un distribuidor global

Del cuello de botella del contenido de producto a la productividad automatizada

En el acelerado mercado global actual, el contenido de producto de alta calidad es la savia de las compras en línea y de unas ventas eficaces. Informa a los clientes, genera confianza y, en última instancia, impulsa las conversiones. Pero ¿qué ocurre cuando la propia fuente de ese contenido esencial se convierte en un obstáculo importante?

Ese es precisamente el desafío al que se enfrentó hace poco un importante distribuidor global. Su catálogo de productos contaba con miles de SKU, y cada uno requería descripciones detalladas, imágenes atractivas y la documentación imprescindible. El problema era que gran parte de esta información estaba escondida en complejas fichas técnicas y manuales en PDF del sitio web del fabricante.

Imagine el enorme esfuerzo manual que esto suponía. El plan inicial del distribuidor era abrumador: contratar personal dedicado para recorrer minuciosamente el sitio del fabricante, copiar y pegar los detalles de cada producto, descargar imágenes y PDF e introducirlo todo a mano en un archivo de Excel. ¡Para más de 2.000 productos! Este enfoque no solo requería mucho tiempo y era propenso a errores, sino que también suponía un consumo considerable de recursos y un importante cuello de botella en su estrategia de salida al mercado.

Entra en escena atronous: convertir los obstáculos en oportunidades

El distribuidor era consciente de la ineficiencia y de los problemas de escalabilidad inherentes a este proceso manual, así que recurrió a atronous en busca de una solución más inteligente. Nuestro equipo está especializado en agilizar la gestión del contenido de producto, y estábamos deseando afrontar este desafío de frente.

Así es como atronous ayudó a este distribuidor global a liberarse de su cuello de botella de contenido y a obtener importantes aumentos de productividad:

1. Extracción y análisis inteligentes de datos web

En lugar de un rastreo genérico del sitio web, empleamos técnicas específicas de ingesta web, con bibliotecas y frameworks optimizados para navegar por estructuras de sitios web complejas y extraer sus datos. Esto implicó:

  • Comprensión del contenido semántico de la página: empleamos modelos de visión artificial capaces de interpretar el contenido de la página para extraer los detalles pertinentes, como los códigos UPC, las referencias de fabricante (MPN) y otros atributos
  • Uso de selectores de contenido como respaldo: utilizamos las herramientas para desarrolladores del navegador y técnicas como los selectores XPath y CSS para localizar con precisión los elementos HTML concretos que contienen los títulos de producto, las descripciones, las URL de las imágenes, los enlaces a los PDF y las tablas de atributos.
  • Gestión fiable de errores: creamos mecanismos para gestionar de forma controlada los cambios en el sitio web, los enlaces rotos y las estructuras de datos incoherentes, lo que minimiza las interrupciones y garantiza la integridad de los datos.
  • Análisis (parsing) y estructuración de datos: una vez extraídos, los datos HTML brutos se analizaron y se estructuraron en un formato utilizable. Esto implicó:
    • Extracción y limpieza de texto: eliminar las etiquetas HTML, los scripts y los estilos innecesarios para centrarse en los detalles esenciales del producto. Utilizar métodos de limpieza de texto para resolver incoherencias de formato, problemas de espaciado y caracteres especiales.
    • Identificación y extracción de atributos: desarrollar una lógica para identificar y extraer los atributos clave del producto, que a menudo se presentan en tablas o listas estructuradas. Esto implicó el reconocimiento de patrones y la normalización de datos para garantizar la coherencia entre las distintas páginas de producto.

2. Análisis de datos e imágenes de archivos PDF

Cuando el sitio web del fabricante alojaba manuales o especificaciones de producto en archivos PDF, nuestro proceso de ingesta se amplió para incorporar técnicas especializadas de análisis de PDF. Este es el desglose de los enfoques técnicos utilizados:

  • Identificación de enlaces y descarga: nuestro motor de ingesta web identificaba los enlaces a archivos PDF dentro del sitio web del fabricante, normalmente en las páginas de producto o en secciones dedicadas a recursos. Esos enlaces se extraían, y los archivos PDF correspondientes se descargaban y se almacenaban de forma segura, en sus propias ubicaciones en la nube.
  • Extracción del contenido de los PDF, elección de las bibliotecas y herramientas adecuadas: según la complejidad y la estructura de los PDF, atronous utilizó diversas bibliotecas y herramientas, de código abierto y comerciales, diseñadas específicamente para el procesamiento de PDF en lenguajes como Python. Para más detalles sobre este paso, consulte este artículo técnico del blog
  • Extracción de datos de tablas:
    • Detección de tablas basada en heurísticas: los algoritmos analizan el diseño del PDF para identificar posibles estructuras de tabla a partir de la presencia de líneas, espaciados y patrones repetidos.
    • Extracción de datos estructurados: una vez identificada una tabla, se utilizan técnicas de análisis más sofisticadas para extraer los datos de las filas y columnas, lo que a menudo exige tratar celdas combinadas y diseños de tabla complejos.
    • Conversión a formatos estructurados: los datos de tabla extraídos suelen convertirse después en formatos estructurados, como listas de diccionarios o estructuras de tipo CSV, para facilitar su mapeo e integración.

3. Conversión automatizada de datos y mapeo de plantillas:

Normalización y limpieza de datos

  • Antes de mapearlos a las plantillas del distribuidor, los datos extraídos pasaron por un proceso de normalización y limpieza. Esto incluyó:
    • Conversión de tipos de datos: asegurarse de que los campos de datos coincidieran con los tipos de datos esperados en las plantillas de destino (p. ej., convertir números en formato de texto a formatos numéricos).
    • Estandarización de unidades de medida: si era necesario, estandarizar las unidades de medida (p. ej., convertir pulgadas a centímetros).
    • Validación de datos: aplicar reglas para identificar y señalar los datos posiblemente incorrectos o ausentes según criterios predefinidos.

Motor de mapeo de plantillas

  • Desarrollamos un motor de mapeo flexible que nos permitió conectar los campos de datos extraídos y normalizados con las columnas y estructuras específicas de las plantillas de carga del distribuidor (probablemente en formatos como CSV o Excel). Esto implicó:
    • Reglas de mapeo configurables: ofrecer una interfaz o archivos de configuración para definir las relaciones entre los campos de datos de origen y los campos de la plantilla de destino.
    • Lógica de derivación de datos: implementar una lógica personalizada dentro del motor de mapeo para derivar campos más complejos cuando fuera necesario (p. ej., combinar varios campos de origen en un único campo de destino).
    • Procesamiento por lotes y automatización: automatizar la aplicación de las reglas de mapeo a los datos extraídos por lotes y generar archivos de salida con el formato correcto, listos para cargarse en los sistemas del distribuidor (p. ej., PIM, ERP, plataforma de e-commerce)

4. Integración de traducción multilingüe:

  • Servicios de traducción mediante API: para gestionar la traducción de los títulos y las descripciones de producto al español y al francés, nos integramos con API de traducción en la nube de reconocida solvencia (p. ej., Google Translate API, Amazon Translate).
  • Flujo de trabajo de traducción automatizado: los títulos y las descripciones extraídos se enviaban automáticamente a la API de traducción elegida. Después, el texto traducido se recibía y se reincorporaba a los datos procesados
  • Consideraciones de calidad: aunque el proceso era totalmente automático, a menudo recomendamos e implementamos opciones de revisión humana de las traducciones, sobre todo para los textos de marketing críticos, con el fin de garantizar la exactitud y la pertinencia cultural.

Pipeline de seis pasos para el procesamiento de datos y el mapeo de plantillas: normalización, conversión de tipos de datos, estandarización de unidades, validación, desarrollo del motor de mapeo y reglas de mapeo configurables

Beneficios técnicos e impacto

Gracias a estas capacidades técnicas, atronous ofreció una solución que era:

  • Escalable: capaz de gestionar grandes volúmenes de datos de producto y de adaptarse al crecimiento futuro del catálogo de productos.
  • Eficiente: automatizaba los procesos de adquisición y preparación de datos, lo que reducía de forma significativa el esfuerzo y el tiempo manuales.
  • Exacta: minimizaba el riesgo de error humano asociado a la introducción manual de datos.
  • Integrada: encajaba con fluidez en los sistemas y flujos de trabajo existentes del distribuidor gracias a una salida basada en plantillas.
  • Lista para el mercado global: nuestras capacidades de traducción automatizada sentaron las bases para la expansión a nuevos mercados.

Conclusión

El aumento del 80 % de la productividad no fue solo un titular: fue el resultado tangible de una infraestructura técnica potente y automatizada. Al sustituir un proceso manual y costoso en recursos por un sistema de creación de catálogos eficiente y escalable, los equipos del distribuidor se liberaron del trabajo más tedioso y pudieron centrarse en tareas de alto valor, como la aprobación de contenidos.

Pase de datos de producto deficientes a fichas verificadas.

Empiece con una conversación sobre sus datos de producto.