Medir la calidad de los datos de producto: la séptima dimensión

La responsabilidad sobre los datos de producto se reparte entre muchas funciones de una empresa, pero la consigna es siempre la misma: “Mejores datos de producto”. Es fácil de decir, pero difícil de llevar a la práctica de forma significativa, porque no se puede mejorar lo que no se mide. La mayoría de los equipos o no miden en absoluto la calidad de los datos de producto, o no consiguen ver el panorama completo.
La calidad de los datos de producto es el grado en que un registro de producto es completo, válido, coherente y exacto para su categoría, de modo que cada canal lo acepte y cada sistema o comprador que lo lea, humano o IA, pueda confiar en él. Hoy en día, eso no basta. Para tener contenido de alta calidad, un producto debe contener datos no solo exactos, sino también relevantes.
La mayoría de los equipos nunca llega tan lejos. Saben que sus datos necesitan mejorar. Perciben el retrabajo y las fichas rechazadas, pero el proceso puede parecer una caja negra. Si no mide lo correcto, cada proyecto de datos se guía por el instinto, y el instinto no escala a cientos de miles de SKU repartidos en cientos de categorías.
Lo que los equipos sí suelen medir, ante todo, es la tasa de llenado (el porcentaje de campos que no están vacíos). Eso cuenta solo una mínima parte de la historia y no dice nada de la calidad. Es fácil de calcular y da sensación de avance. Por desgracia, también es la cifra con más probabilidades de decirle que sus datos están bien justo hasta que un marketplace rechaza la mitad. E incluso si la ficha sale en línea, lo más probable es que no se encuentre. Medir bien la calidad de los datos de producto exige algunas dimensiones más. Podemos tomar prestadas la mayoría de ellas de los marcos genéricos de calidad de datos, pero también hay una dimensión específica de los datos de producto que es clave para activar con éxito su catálogo en todos los canales.
Las seis primeras dimensiones
La calidad de datos genérica tiene un vocabulario estándar, y la mayor parte se aplica también a los datos de producto. Cada dimensión tiene una métrica que realmente se puede calcular.
- Completitud. La proporción de atributos obligatorios que tienen un valor.
- Validez. La proporción de valores que se ajustan al formato y al tipo que exige su campo. Un UPC que no supera la comprobación de su dígito verificador no es válido. Un peso indicado como “mediano” no suele ser válido. Los identificadores (UPC, EAN, GTIN, etc.) son el punto donde medir la validez aporta más valor, porque un identificador no válido significa una ficha rechazada.
- Coherencia. La proporción de registros cuyos campos no se contradicen entre sí. Un título que dice acero inoxidable junto a un atributo de material que dice aluminio es un fallo de coherencia, aunque ambos campos tengan un valor y cada uno esté bien formado por sí solo.
- Unicidad. La tasa de duplicados no deseados. Dos registros para el mismo producto, o un identificador reutilizado en dos productos, corrompe todo en las etapas posteriores, desde el inventario hasta las recomendaciones.
- Exactitud. Si un valor es realmente cierto para el producto. Es difícil de medir, porque normalmente requiere una fuente de referencia con la que contrastarlo, y es aquí donde las reglas de la categoría se vuelven imprescindibles.
- Actualidad. Si el registro refleja el estado actual del producto (su precio, su disponibilidad, sus especificaciones) en el momento en que un canal lo lee.
Mida solo estas seis y ya estará por delante de la mayoría de los equipos. Sin embargo, hay más que tener en cuenta, y la relevancia de un atributo para una búsqueda o una decisión de compra (no solo su completitud o su exactitud) complica aún más las cosas.
La dimensión que los marcos pasan por alto: la relevancia
Un registro puede ser completo, válido, coherente, único, exacto y actualizado, y aun así no superar la única prueba que importa en el momento de la venta. Nada de eso importa si no le dice al comprador lo que vino a averiguar.
Esto nos lleva a la séptima dimensión, que es la decisiva: la relevancia. Plantea un tipo de pregunta distinto al de las otras seis. Las demás preguntan si los datos son correctos. La relevancia pregunta si a alguien le importan. ¿Este atributo, este dato, esta formulación responde a algo que un comprador (humano o IA) realmente intenta decidir?
Piense en unos leggings. Un registro perfectamente exacto puede indicar la composición de fibras, las instrucciones de cuidado y el país de origen. Puede tener una página de producto (PDP) perfectamente válida, coherente y exacta y, aun así, no mencionar nunca que son de cintura alta, que tienen bolsillos o que mantienen su forma al hacer una sentadilla. El comprador no busca “82 % de poliamida”. Busca los beneficios que le importan. Este es un ejemplo de una ficha de producto sólida:

Sí menciona que son de cintura alta y que tienen bolsillos. Pero el contenido podría ir incluso un paso más allá. ¿Qué tamaño tienen los bolsillos? ¿Cabría su teléfono en ellos? ¿Cuál es la proporción entre poliéster y elastano, para que el comprador entienda cuánto estiran? ¿Se pueden secar en secadora?
Incluso un producto que se considera completo según todas las definiciones estándar puede carecer de los datos relevantes para ser encontrado o indexado correctamente por los agentes de IA. Esto se debe a que la relevancia no figura en los marcos estándar de calidad de datos. Esos marcos se crearon para juzgar los datos en relación consigo mismos (su formato, su lógica interna, su fuente de referencia), y todas esas cosas se definen dentro de su propio sistema. La relevancia la define el comprador, fuera de esos sistemas, y es la única dimensión que usted no puede certificar mirando solo su propio catálogo. Un valor es relevante solo en la medida en que le resulta útil a un consumidor.
Lo que quieren los compradores y cómo compran es un objetivo en cambio constante. Los atributos que decidieron una compra la temporada pasada no son los que la deciden en esta. Aparecen nuevos casos de uso, nuevas comparaciones se convierten en el factor de desempate, el lenguaje de búsqueda cambia con el tiempo y los asistentes de IA empiezan a pedir datos que ninguna plantilla había previsto. Un registro perfectamente relevante en el lanzamiento puede perder vigencia rápidamente, no porque haya cambiado algún valor, sino porque cambió a su alrededor el comportamiento del consumidor (o del agente). La relevancia es la única dimensión que se deteriora mientras sus datos permanecen exactamente igual. Eso es lo que la hace difícil, y por eso la relevancia no puede ser un proyecto que se da por terminado. Hay que mantenerla y optimizarla de forma continua.
Por eso la medición tiene que formar parte de un proceso, no de una auditoría. El proceso de datos de atronous optimiza de forma continua. En cada registro se comprueba la integridad de los identificadores, con una tasa de aprobación del 100 % en formato y dígito verificador, y cero duplicados en los identificadores entregados. Cada atributo se valida según el vocabulario de restricciones de su categoría, en más de 400 categorías, cada una con sus reglas aplicadas de forma independiente. La completitud se puntúa según lo que exige la categoría, no según lo que pide una plantilla. Y el contenido se puede puntuar y optimizar según lo que los compradores y los agentes de IA buscan realmente. El proceso mantiene el contenido actualizado a medida que cambia esa demanda. Una entrega empresarial típica detecta 18 categorías distintas de problemas de calidad de datos y devuelve cada una con su justificación, con una tasa de éxito del 98 % o superior. Nada se descarta en silencio.
Por qué la relevancia merece el esfuerzo
Medir correctamente la calidad de los datos de producto da más trabajo que leer una tasa de llenado en un panel. Mantener los datos relevantes da todavía más trabajo, porque nunca termina del todo. Vale la pena por tres razones.
- Le indica dónde se encuentra realmente, por registro y por categoría, para que un proyecto de datos pueda apuntar a un objetivo en lugar de basarse en suposiciones.
- Predice los resultados que le importan, porque las cifras que la hacen variar, la completitud que exige la categoría y la relevancia, son las mismas cifras que determinan si un producto se encuentra, se corresponde con la intención de búsqueda y se compra.
- Se está convirtiendo en la diferencia entre ser encontrado y ser ignorado. Quien lee un registro de producto es, cada vez más, un agente de IA que no navega por una página. Lee datos estructurados, compara a partir de ellos y decide en una frase si su producto responde a la pregunta. Un atributo que le importa al comprador y que falta no es un campo vacío. Es un motivo para recomendar a otro. Y como lo que pide el agente no deja de cambiar, la relevancia nunca queda resuelta de una vez por todas. Se mantiene.
Que un registro sea exacto y completo es lo mínimo exigible, y por sí solo no basta. Un registro puede ser exacto y completo y, aun así, responder a una pregunta que nadie está haciendo. Lo que separa el contenido de calidad del contenido simplemente correcto es si contiene lo que el comprador quiere saber, ahora mismo, en el lenguaje con el que lo pregunta. Como ese objetivo nunca deja de moverse, la única forma de adelantarse a él es con un proceso que mantenga cada registro actualizado, relevante y optimizado tanto para los compradores humanos como para los agentes de IA, cada vez que cambia la pregunta.
Vea sus propios datos medidos
La forma más rápida de saber en qué situación están sus datos de producto es ver una muestra de ellos medida y devuelta. Eso es lo que hace la Evaluación de Calidad de Datos de atronous. Envíe hasta 50 SKU desde su PIM o su ERP, tal como están en su sistema, y los pasamos por el mismo proceso en el que confían nuestros clientes empresariales. En un plazo de cinco días hábiles recibe la muestra generada y validada, junto con las recomendaciones de taxonomía y esquema que respaldan el trabajo y una sesión de trabajo con un especialista para revisar lo que encontramos, lo que agregamos y lo que significa para su catálogo a gran escala.
La evaluación utiliza sus propios registros para mostrarle exactamente dónde necesitan mejorar los datos y cómo son realmente unos datos mejores.
Solicite su Evaluación de Calidad de Datos.
Inteligencia en cada atributo.
Preguntas frecuentes
¿Qué es la calidad de los datos de producto?
La calidad de los datos de producto es el grado en que un registro de producto es completo, válido, coherente y exacto para su categoría, de modo que cada canal lo acepte y cada sistema o comprador que lo lea, humano o IA, pueda confiar en él. Ser correcto no basta por sí solo: un registro de alta calidad también contiene los datos relevantes para lo que los compradores y los agentes de IA realmente intentan decidir.
¿Cómo se mide la calidad de los datos de producto?
En siete dimensiones. Seis provienen de los marcos genéricos de calidad de datos, cada una con una métrica calculable: completitud, validez, coherencia, unicidad, exactitud y actualidad. La séptima, la relevancia, plantea si el registro responde a lo que un comprador o un agente de IA realmente intenta decidir. Como ese objetivo cambia constantemente, la relevancia debe medirse de forma continua en un proceso, no una sola vez en una auditoría.