Feedoptimise
Feedoptimise
menu
Probar Reservar demo

Pruebas A/B estadísticamente significativas para feeds de productos

Medir si los esfuerzos de optimización valieron la pena siempre ha sido uno de los mayores desafíos de la optimización de feeds de productos. Ajustar un título de producto, reformular una descripción de producto con la ayuda de la IA, cambiar una imagen o reorganizar atributos de producto es bastante fácil. Saber si el cambio realmente mejoró el rendimiento comercial, o solo lo pareció, es más difícil.

Esta es la pregunta para la que se creó Feedoptimise A/B Testing Suite.

Integrada directamente en el sistema de gestión de feeds de productos de Feedoptimise, la A/B Testing Suite integra el proceso de transformación del feed, la ejecución de experimentos, la recopilación de datos de rendimiento a nivel de ítem, la toma de decisiones en base a ellos y la implementación de los ganadores en un flujo de trabajo único y sin fricciones.

A diferencia de simplemente dividir los productos en dos segmentos y averiguar cuál de los dos produjo mejores resultados en términos de CTR, tasa de conversión o ROAS, Feedoptimise decide si la diferencia es lo suficientemente estadísticamente significativa como para declarar la variación ganadora.

El motor de decisión de Feedoptimise tiene en cuenta factores como la confianza estadística, los intervalos de confianza, el lift mínimo, el tamaño de la muestra, la duración del experimento, el retraso de conversión y los guardarraíles de rendimiento al seleccionar al ganador.

Una vez que hay evidencia disponible, la variación ganadora se devuelve al feed mediante un proceso de implementación controlado y previsualizable.

Es un enfoque completamente nuevo para la optimización de feeds de productos, ya que los comerciantes no tienen que hacer un cambio y esperar que funcione, sino probar la hipótesis e implementar cambios respaldados por resultados reales.

Qué incluye la última versión

  • Pruebas en cualquier campo del feed. Títulos, descripciones, tipos de producto, categorías, imágenes, cualquier atributo de salida en tu mapeo del feed.
  • Dos diseños de experimento. Pruebas duplicadas con ambos lados ejecutándose simultáneamente con diferentes IDs de ítem. Pruebas rotativas con un solo ID de ítem y alternancia de toda la población durante fases.
  • Tus propios datos de rendimiento. Conecta Google Ads, Google Analytics, Google Merchant Center, Shopify, WooCommerce, Magento, Centra, Facebook o un informe personalizado.
  • Un motor de decisión con configuración predeterminada. 95% de confianza, 5% de lift mínimo, 14 días mínimos, 5.000 impresiones, 300 clics y 30 conversiones por lado, un retraso de conversión de 7 días y una duración máxima de 60 días.
  • Veredictos por ítem. Una tabla que muestra qué productos individuales reunieron evidencia suficiente para actuar, por separado del resultado general.
  • Una ruta de implementación revisada. Los ganadores pasan al Shared Override mediante una instantánea revisada previamente. No se harán cambios en tu feed en vivo hasta tu aprobación.

Por qué la significancia estadística importa en las pruebas de feeds

Los feeds se ejecutan dentro de la subasta. Los volúmenes de tráfico fluctúan según el día de la semana, las pujas de los competidores, el ritmo del presupuesto, la estacionalidad y las actualizaciones del algoritmo de Google. En este contexto, una diferencia de CTR del 4% entre dos formatos de título no representa una señal relevante para la mayoría de los catálogos.

Aun así, la gente toma decisiones basándose en esas diferencias. Implementan un formato de título en 40.000 SKUs, esperan un trimestre mientras el rendimiento deriva, y no saben si siquiera causó algún impacto. Esta decisión tiene el coste tanto del esfuerzo de despliegue desperdiciado como, más importante, de arrastrar una suposición incorrecta a las siguientes pruebas.

Hay tres causas principales de error aquí.

  1. Leer un resultado antes de que exista la información. La guía para ejecutar pruebas suplementarias de feed para optimización de títulos suele indicar que 100 clics son suficientes como punto de datos para sacar conclusiones sobre la tendencia. Esto es suficiente para el CTR. No es ni de lejos suficiente para sacar conclusiones sobre una tasa de conversión o el ROAS, y así es como la mayoría de los equipos de feed pierden dinero.
  2. Optimizar una métrica en el terreno de otra métrica. Añade "Black Friday" y "Free Gift" a un título y el CTR se dispara. Sin embargo, la tasa de conversión y el ROAS pueden desplomarse, porque el título atrajo visitantes que no compran al sitio. La optimización de títulos centrada solo en una métrica declarará una victoria falsa aquí.
  3. Detener la prueba cuando el número se ve bien. Revisiones diarias del panel seguidas de detener la prueba en cuanto alcanza un pico al alza crean muchos falsos positivos. El lift temprano de la prueba proviene de un paseo aleatorio. Detén en la cima del lift y medirás la cima del lift.

Feedoptimise se encarga de cada uno de estos como un elemento estructural integrado.

Dos métodos experimentales: pruebas duplicadas y rotativas

Dado que distintos canales de comercio implican diferentes restricciones en los experimentos, Feedoptimise emplea dos metodologías distintas para las pruebas.

1. Pruebas A/B duplicadas

Al realizar un experimento duplicado, Feedoptimise publica:

A - el producto antiguo, con el mismo ID antiguo y los valores antiguos.
B - un producto duplicado, con un nuevo ID predecible y nuevos valores probados.

Como resultado, ambas variantes pueden recopilar datos de rendimiento al mismo tiempo.

La gran comparación simultánea del experimento estará disponible cuando el destino acepte ambos IDs de producto y pueda dirigir tráfico a ambas versiones.

Por ejemplo:

Old ID: 34130964
Old Title: Running Shoes
New ID: M-34130964
New Title: Men's Lightweight Running Shoes

Ambos productos compiten dentro del mismo período de tiempo, y Feedoptimise atribuye los resultados del experimento.

2. Pruebas A/B rotativas

Hay destinos donde no pueden existir productos duplicados.

En esos casos, Feedoptimise podrá mantener el mismo ID para el experimento, pero rotarlo entre los valores antiguos y los nuevos.

La primera fase puede usar la versión antigua del experimento. Luego viene la nueva versión.

Feedoptimise ofrece realizar rotaciones ya sea en el tiempo o en función del volumen acumulado de métricas (por ejemplo, impresiones).

Las rotaciones basadas en volumen acumulado de métricas son especialmente valiosas, ya que el experimento puede rotar dependiendo de una cantidad aproximadamente igual de exposición recopilada.

Conecta los experimentos con datos reales de rendimiento

Feedoptimise vincula los experimentos con fuentes de reporting a nivel de ítem, que incluyen:

Plataformas publicitarias, plataformas de analítica, plataformas de comercio e informes personalizados.

Según la configuración de la cuenta, las fuentes de reporting pueden incluir:

Google Ads, Google Analytics, Google Merchant Center, reporting de Facebook/Meta, Shopify, WooCommerce, Magento, e informes personalizados basados en URL.

Proceso de toma de decisiones

Hay seis factores entre “la línea probada es más alta” y “probada gana”.

1. En primer lugar, hay una métrica principal seleccionada de antemano

Elige una métrica que corresponda a la hipótesis: ROAS, valor por clic, valor por conversión, tasa de conversión o CTR. El algoritmo de selección automática prefiere métricas basadas en ROAS a nivel de informe. La selección posterior de una métrica que favorece a la variante es cómo los equipos generan victorias artificialmente.

Feedoptimise las calcula en base a los roles aditivos subyacentes. El mapeo de tus columnas de origen se realiza en términos de cinco roles semánticos:

Rol semántico:
Columnas de origen típicas:
Exposición / impresiones
impressions, views
Clics / visitas
clicks, sessions
Conversiones / resultados
conversions, orders
Coste / gasto
cost, ad_spend
Valor de conversión / ingresos
conv_value, revenue

De estos, el motor extrae el CTR, la tasa de conversión, el CPC, el ROAS, el valor por clic y el valor por conversión. Es el mapeo de cantidades a números lo que permite realizar un remuestreo válido.

2. Un intervalo de confianza, no solo un número

Realiza una prueba durante dos semanas y obtienes una sola cifra: la probada rindió un 8% mejor. Realiza la prueba otras dos semanas y da una respuesta diferente, ya que los clics y las conversiones no se distribuyen de manera uniforme.

Feedoptimise analiza esta incertidumbre. El motor repite tu prueba miles de veces sobre tus datos diarios reales de todas las maneras posibles y te da un intervalo en el que el lift verdadero podría estar.

Observed lift:   +8%
95% CI:          +2% to +14%

Todas las cifras en este intervalo son positivas, por lo tanto, la probada gana.

Observed lift:    +8%
95% CI:           -3% to +18%

Mismo titular. Este intervalo contiene cero, por lo tanto la diferencia podría ser +18% y -3% y tus datos no te permiten distinguir entre ellas. La conclusión sigue siendo inconclusa.

El nivel de confianza significa cuán fiables son los datos para confirmar una cierta dirección de diferencia. No es la probabilidad del beneficio del despliegue.

3. Tu lift mínimo preestablecido de antemano

La significancia estadística y la relevancia práctica son conceptos diferentes. Podría haber un lift del 0,4% en ROAS, que será real pero no lo suficientemente valioso como para implementarlo en todo el catálogo. El lift mínimo predeterminado es 5%. La rigurosidad estándar pide superar cero y el lift mínimo. La configuración estricta necesita que todo el intervalo esté por encima del umbral de lift mínimo.

4. Umbrales de muestra en ambos lados

Los valores predeterminados son 5.000 impresiones, 300 clics y 30 conversiones por cada lado y 14 días mínimos.

Por cada lado marca la diferencia. Si un informe dice que tienes 10.000 impresiones, parece bien hasta que ves que 9.200 impresiones pertenecen al conjunto de anuncios original. El umbral se mantendrá correctamente en estado En espera. Los números agregados ocultan precisamente ese tipo de información.

Los umbrales por ítem funcionan por separado con 1.000 impresiones, 100 clics y 10 conversiones por cada lado. Es posible tener una conclusión sólida a nivel de informe mientras la mayoría de los SKUs individuales estarían en la etapa de Datos insuficientes. Es el estado estándar de un catálogo de cola larga.

5. Retraso de conversión

Los pedidos llegan después de los clics. El retraso de conversión mantiene alejados los días recientes de la muestra de decisión para que se contabilicen las llegadas tardías. El valor predeterminado es de siete días, y debes especificarlo según el retraso real de atribución de tu plataforma. Una prueba puede llegar a la fecha de finalización y aun así estar En espera por retraso de conversión, lo que significa que el sistema se niega a evaluar un conjunto de datos incompleto.

6. Guardarraíles

Los guardarraíles controlan el ROAS, la tasa de conversión, el CPC y el valor por clic mientras se ejecuta la métrica principal. El fallo de un guardarraíl prohibirá que una versión probada gane. Un ejemplo típico es cambiar un título que aumenta el CTR en un 12% pero disminuye la tasa de conversión en un 20%. La métrica principal está bien, pero el guardarraíl detecta el problema y te da un veredicto de Guardarraíl fallido en lugar de Probada está ganando.

Los guardarraíles no impiden que la versión original gane. Mantener lo que ya tienes no supone riesgos adicionales para ti.

Veredictos posibles

  • Probada está ganando
  • Original está ganando
  • Aún no hay decisión
  • Recopilando datos
  • En espera por duración mínima
  • En espera por exposición
  • En espera por retraso de conversión
  • Guardarraíl fallido
  • Datos insuficientes

Siete de nueve veredictos son la negativa a tomar una decisión. Esta proporción es el objetivo. "No hay ganador" es un resultado experimental válido, y una herramienta de pruebas que siempre produce un ganador es inútil.

Decisiones de producto: qué SKUs realmente mejoraron

Las victorias de producto no siempre son universales dentro de una prueba, solo lo suficientemente positivas en conjunto.

La pestaña Decisiones de producto analiza productos individuales por separado del análisis agregado, ya sea a nivel de padre con métricas de variantes consolidadas o como pares individuales de variante padre-original a padre-probada. Cada fila incluye un ganador, una puntuación de confianza, un porcentaje de lift, las métricas reales, un estado, una evaluación de guardarraíl y si califica o no como instantánea. Profundiza en una fila para ver las métricas base tanto de original como de probada, su ratio, el umbral específico usado para el estado y el historial de decisiones.

Es aquí donde ocurren los despliegues selectivos. Simplemente aplica el título de prueba ganador a los 340 productos en los que ganó y deja los otros productos como están.

Del veredicto al feed en vivo

Una prueba ganadora no toca tu feed. La publicación pasa por tres pasos revisados.

  1. Instantánea. Decide qué pruebas deben desplegarse con la ayuda de Implementar ganadores probados para un despliegue selectivo, Guardar decisiones ganadoras del original para registrar lo que ha funcionado, o Aplicar decisión de todo el informe, si un experimento se planificó como una única decisión para todas las personas.
  2. Vista previa. Cada diálogo de instantánea realiza primero una ejecución en seco. Informa sobre el número de unidades evaluadas, calificadas, ganadores y su estado, unidades no atribuibles y una muestra de filas que escribe. Las unidades que no pueden atribuir no contienen valores de campo capturados para el lado seleccionado, por lo tanto se omitirán al guardar. Considera esas filas antes de guardarlas.
  3. Override. Las filas calificadas se guardan en un Shared Override. Aplicar un override a un feed es un paso separado del mapeo del feed, con su propia etapa de vista previa. Los ítems que no estén presentes en un override conservarán su valor del feed.

Vale la pena mencionar dos opciones. Los valores a guardar son independientes del filtro de ganador: el primero determina qué filas califican, y el segundo qué valores del lado se escriben.

Cada despliegue es siempre auditable y se puede deshacer. En caso de un feed importante, usa la vista previa del feed antes de desplegarlo en el feed en vivo.

Feedoptimise frente a otros enfoques de pruebas de feeds

Debe señalarse que no todas las funciones de pruebas A/B ofrecen las mismas capacidades de prueba.

El proceso de pruebas de feed, que está muy difundido y es conocido, incluye cuatro pasos idénticos: división de productos en segmentos, cambio de contenido, recopilación de datos de rendimiento, comparación de métricas. Feedoptimise hace todos los pasos mencionados arriba y va más allá: toma la decisión final.

Capacidad
Google Product Data Experiments
Pruebas A/B típicas de herramientas de feed
Pruebas A/B de Feedoptimise
Campos testeables
Títulos e imágenes
Principalmente títulos
Cualquier campo de salida
Canales medidos
Google Shopping y PMax
Varía
Cualquier canal al que sirva tu feed
Diseño de prueba
División de tráfico simultánea
Normalmente simultánea
Duplicada o rotativa
Pruebas rotativas con el mismo ID
No
Varía
Sí, programadas
Rotación por volumen de rendimiento
No
Rara
Sí, en cualquier métrica aditiva
Fuentes de datos
Google
Conectadas a la plataforma
Google Ads, GA, GMC, Shopify, WooCommerce, Magento, Centra, Facebook, informes personalizados
Objetivo principal fijado de antemano
NoBásico
Sí, seis métricas disponibles
Intervalo de confianza del lift
No se muestra
Raro
Sí, remuestreado a partir de datos diarios
Manejo del retraso de conversión
InternoRaro
Sí, 7 días por defecto
Guardarraíles de métricas secundarias
No
Raro
Sí, en ROAS, CVR, CPC, valor por clic
Modos de rigurosidad
No
Raro
Estándar y estricto
Veredicto explícito de sin ganador
No documentado
Raro
Sí, siete estados distintos de negativa
Veredictos por SKU
No
Raro
Sí, para CTR y tasa de conversión
Cronología de decisión a lo largo de la prueba
No
NoSí, lift y límites del intervalo por día
Vista previa de ejecución en seco antes de escribir nada
No
Raro
Sí, en cada instantánea
Despliegue selectivo por ítem
Aplicar variante a todos
Raro
Sí, mediante Shared Override


Deja de adivinar. Empieza a probar.

La optimización de feeds no debería detenerse una vez que se crea un título, una imagen o un atributo: aquí es donde comienzan las pruebas.

Con las pruebas A/B de Feedoptimise, minoristas y agencias pueden contrastar sus datos de producto con la realidad, verificar si los cambios tienen suficiente mérito detrás y transformar de forma segura ganadores calificados en victorias reales de optimización de feeds.

Empieza tu prueba gratuita o Reserva una demo

Preguntas frecuentes

  • ¿Qué son las pruebas A/B estadísticamente significativas para feeds de productos?

    Las pruebas A/B estadísticamente significativas para feeds de productos son un flujo de trabajo experimental en el que se prueban variantes del feed con tráfico real y un motor de decisión comprueba intervalos de confianza, lift mínimo, tamaño de muestra, duración, retraso de conversión y guardarraíles antes de declarar una versión ganadora o negarse a decidir.

  • ¿Cómo mejora Feedoptimise A/B Testing la optimización de feeds de productos?

    Feedoptimise A/B Testing permite a los comerciantes probar cualquier campo del feed, conectar datos reales de rendimiento, ejecutar experimentos duplicados o rotativos y usar un motor de decisión para desplegar solo ganadores estadísticamente probados en lugar de depender de la intuición o de diferencias ruidosas de CTR.

  • ¿Cuál es la diferencia entre las pruebas A/B duplicadas y rotativas en feeds de productos?

    Las pruebas A/B duplicadas crean un segundo producto con un nuevo ID para que ambas variantes se ejecuten simultáneamente, mientras que las pruebas A/B rotativas mantienen el mismo ID y alternan valores antiguos y nuevos a lo largo del tiempo o por volumen de impresiones cuando un canal no permite productos duplicados.

  • ¿Qué métricas y fuentes de datos puede usar Feedoptimise para pruebas A/B de feeds?

    Feedoptimise puede usar datos a nivel de ítem de Google Ads, Google Analytics, Google Merchant Center, Facebook, Shopify, WooCommerce, Magento, Centra e informes personalizados, y optimizar para ROAS, valor por clic, valor por conversión, tasa de conversión o CTR con guardarraíles en ROAS, CVR, CPC y valor por clic.

  • ¿Por qué es importante la significancia estadística en las pruebas de feeds de productos?

    La significancia estadística evita que los equipos de feed actúen sobre fluctuaciones aleatorias en CTR, tasa de conversión o ROAS causadas por subastas, estacionalidad y ritmo del presupuesto, reduciendo falsos positivos por picos tempranos, muestras con poca potencia y optimizaciones de una sola métrica que perjudican la rentabilidad.

  • ¿Cómo determina el motor de decisión de Feedoptimise una variante ganadora del feed?

    El motor de decisión preselecciona una métrica principal, construye intervalos de confianza del lift, aplica umbrales de lift mínimo, umbrales de muestra, retraso de conversión y guardarraíles, y luego emite veredictos como Probada está ganando, Original está ganando, Guardarraíl fallido o varios estados de no decisión cuando la evidencia es insuficiente.

  • ¿Cómo puedo desplegar los resultados ganadores de una prueba A/B en mi feed de productos en vivo?

    Feedoptimise utiliza un despliegue en tres pasos: crear una instantánea de ganadores, ejecutar una vista previa de ejecución en seco que muestra ítems calificados y filas de muestra, y luego guardar los cambios en un Shared Override que puede aplicarse selectivamente en el mapeo del feed, asegurando que cada despliegue sea revisable y reversible.