Medir si los esfuerzos de optimización valieron la pena siempre ha sido uno de los mayores desafíos de la optimización de feeds de productos. Ajustar un título de producto, reformular una descripción de producto con la ayuda de la IA, cambiar una imagen o reorganizar atributos de producto es bastante fácil. Saber si el cambio realmente mejoró el rendimiento comercial, o solo lo pareció, es más difícil.
Esta es la pregunta para la que se creó Feedoptimise A/B Testing Suite.
Integrada directamente en el sistema de gestión de feeds de productos de Feedoptimise, la A/B Testing Suite integra el proceso de transformación del feed, la ejecución de experimentos, la recopilación de datos de rendimiento a nivel de ítem, la toma de decisiones en base a ellos y la implementación de los ganadores en un flujo de trabajo único y sin fricciones.
A diferencia de simplemente dividir los productos en dos segmentos y averiguar cuál de los dos produjo mejores resultados en términos de CTR, tasa de conversión o ROAS, Feedoptimise decide si la diferencia es lo suficientemente estadísticamente significativa como para declarar la variación ganadora.
El motor de decisión de Feedoptimise tiene en cuenta factores como la confianza estadística, los intervalos de confianza, el lift mínimo, el tamaño de la muestra, la duración del experimento, el retraso de conversión y los guardarraíles de rendimiento al seleccionar al ganador.
Una vez que hay evidencia disponible, la variación ganadora se devuelve al feed mediante un proceso de implementación controlado y previsualizable.
Es un enfoque completamente nuevo para la optimización de feeds de productos, ya que los comerciantes no tienen que hacer un cambio y esperar que funcione, sino probar la hipótesis e implementar cambios respaldados por resultados reales.
Qué incluye la última versión
- Pruebas en cualquier campo del feed. Títulos, descripciones, tipos de producto, categorías, imágenes, cualquier atributo de salida en tu mapeo del feed.
- Dos diseños de experimento. Pruebas duplicadas con ambos lados ejecutándose simultáneamente con diferentes IDs de ítem. Pruebas rotativas con un solo ID de ítem y alternancia de toda la población durante fases.
- Tus propios datos de rendimiento. Conecta Google Ads, Google Analytics, Google Merchant Center, Shopify, WooCommerce, Magento, Centra, Facebook o un informe personalizado.
- Un motor de decisión con configuración predeterminada. 95% de confianza, 5% de lift mínimo, 14 días mínimos, 5.000 impresiones, 300 clics y 30 conversiones por lado, un retraso de conversión de 7 días y una duración máxima de 60 días.
- Veredictos por ítem. Una tabla que muestra qué productos individuales reunieron evidencia suficiente para actuar, por separado del resultado general.
- Una ruta de implementación revisada. Los ganadores pasan al Shared Override mediante una instantánea revisada previamente. No se harán cambios en tu feed en vivo hasta tu aprobación.
Por qué la significancia estadística importa en las pruebas de feeds
Los feeds se ejecutan dentro de la subasta. Los volúmenes de tráfico fluctúan según el día de la semana, las pujas de los competidores, el ritmo del presupuesto, la estacionalidad y las actualizaciones del algoritmo de Google. En este contexto, una diferencia de CTR del 4% entre dos formatos de título no representa una señal relevante para la mayoría de los catálogos.
Aun así, la gente toma decisiones basándose en esas diferencias. Implementan un formato de título en 40.000 SKUs, esperan un trimestre mientras el rendimiento deriva, y no saben si siquiera causó algún impacto. Esta decisión tiene el coste tanto del esfuerzo de despliegue desperdiciado como, más importante, de arrastrar una suposición incorrecta a las siguientes pruebas.
Hay tres causas principales de error aquí.
- Leer un resultado antes de que exista la información. La guía para ejecutar pruebas suplementarias de feed para optimización de títulos suele indicar que 100 clics son suficientes como punto de datos para sacar conclusiones sobre la tendencia. Esto es suficiente para el CTR. No es ni de lejos suficiente para sacar conclusiones sobre una tasa de conversión o el ROAS, y así es como la mayoría de los equipos de feed pierden dinero.
- Optimizar una métrica en el terreno de otra métrica. Añade "Black Friday" y "Free Gift" a un título y el CTR se dispara. Sin embargo, la tasa de conversión y el ROAS pueden desplomarse, porque el título atrajo visitantes que no compran al sitio. La optimización de títulos centrada solo en una métrica declarará una victoria falsa aquí.
- Detener la prueba cuando el número se ve bien. Revisiones diarias del panel seguidas de detener la prueba en cuanto alcanza un pico al alza crean muchos falsos positivos. El lift temprano de la prueba proviene de un paseo aleatorio. Detén en la cima del lift y medirás la cima del lift.
Feedoptimise se encarga de cada uno de estos como un elemento estructural integrado.
Dos métodos experimentales: pruebas duplicadas y rotativas
Dado que distintos canales de comercio implican diferentes restricciones en los experimentos, Feedoptimise emplea dos metodologías distintas para las pruebas.
1. Pruebas A/B duplicadas
Al realizar un experimento duplicado, Feedoptimise publica:
A - el producto antiguo, con el mismo ID antiguo y los valores antiguos.
B - un producto duplicado, con un nuevo ID predecible y nuevos valores probados.
Como resultado, ambas variantes pueden recopilar datos de rendimiento al mismo tiempo.
La gran comparación simultánea del experimento estará disponible cuando el destino acepte ambos IDs de producto y pueda dirigir tráfico a ambas versiones.
Por ejemplo:
Old ID: 34130964
Old Title: Running Shoes
New ID: M-34130964
New Title: Men's Lightweight Running Shoes
Ambos productos compiten dentro del mismo período de tiempo, y Feedoptimise atribuye los resultados del experimento.
2. Pruebas A/B rotativas
Hay destinos donde no pueden existir productos duplicados.
En esos casos, Feedoptimise podrá mantener el mismo ID para el experimento, pero rotarlo entre los valores antiguos y los nuevos.
La primera fase puede usar la versión antigua del experimento. Luego viene la nueva versión.
Feedoptimise ofrece realizar rotaciones ya sea en el tiempo o en función del volumen acumulado de métricas (por ejemplo, impresiones).
Las rotaciones basadas en volumen acumulado de métricas son especialmente valiosas, ya que el experimento puede rotar dependiendo de una cantidad aproximadamente igual de exposición recopilada.
Conecta los experimentos con datos reales de rendimiento
Feedoptimise vincula los experimentos con fuentes de reporting a nivel de ítem, que incluyen:
Plataformas publicitarias, plataformas de analítica, plataformas de comercio e informes personalizados.
Según la configuración de la cuenta, las fuentes de reporting pueden incluir:
Google Ads, Google Analytics, Google Merchant Center, reporting de Facebook/Meta, Shopify, WooCommerce, Magento, e informes personalizados basados en URL.
Proceso de toma de decisiones
Hay seis factores entre “la línea probada es más alta” y “probada gana”.
1. En primer lugar, hay una métrica principal seleccionada de antemano
Elige una métrica que corresponda a la hipótesis: ROAS, valor por clic, valor por conversión, tasa de conversión o CTR. El algoritmo de selección automática prefiere métricas basadas en ROAS a nivel de informe. La selección posterior de una métrica que favorece a la variante es cómo los equipos generan victorias artificialmente.
Feedoptimise las calcula en base a los roles aditivos subyacentes. El mapeo de tus columnas de origen se realiza en términos de cinco roles semánticos:
| Rol semántico: | Columnas de origen típicas: |
| Exposición / impresiones | impressions, views |
| Clics / visitas | clicks, sessions |
| Conversiones / resultados | conversions, orders |
| Coste / gasto | cost, ad_spend |
| Valor de conversión / ingresos | conv_value, revenue |
De estos, el motor extrae el CTR, la tasa de conversión, el CPC, el ROAS, el valor por clic y el valor por conversión. Es el mapeo de cantidades a números lo que permite realizar un remuestreo válido.
2. Un intervalo de confianza, no solo un número
Realiza una prueba durante dos semanas y obtienes una sola cifra: la probada rindió un 8% mejor. Realiza la prueba otras dos semanas y da una respuesta diferente, ya que los clics y las conversiones no se distribuyen de manera uniforme.
Feedoptimise analiza esta incertidumbre. El motor repite tu prueba miles de veces sobre tus datos diarios reales de todas las maneras posibles y te da un intervalo en el que el lift verdadero podría estar.
Observed lift: +8%
95% CI: +2% to +14%
Todas las cifras en este intervalo son positivas, por lo tanto, la probada gana.
Observed lift: +8%
95% CI: -3% to +18%
Mismo titular. Este intervalo contiene cero, por lo tanto la diferencia podría ser +18% y -3% y tus datos no te permiten distinguir entre ellas. La conclusión sigue siendo inconclusa.
El nivel de confianza significa cuán fiables son los datos para confirmar una cierta dirección de diferencia. No es la probabilidad del beneficio del despliegue.
3. Tu lift mínimo preestablecido de antemano
La significancia estadística y la relevancia práctica son conceptos diferentes. Podría haber un lift del 0,4% en ROAS, que será real pero no lo suficientemente valioso como para implementarlo en todo el catálogo. El lift mínimo predeterminado es 5%. La rigurosidad estándar pide superar cero y el lift mínimo. La configuración estricta necesita que todo el intervalo esté por encima del umbral de lift mínimo.
4. Umbrales de muestra en ambos lados
Los valores predeterminados son 5.000 impresiones, 300 clics y 30 conversiones por cada lado y 14 días mínimos.
Por cada lado marca la diferencia. Si un informe dice que tienes 10.000 impresiones, parece bien hasta que ves que 9.200 impresiones pertenecen al conjunto de anuncios original. El umbral se mantendrá correctamente en estado En espera. Los números agregados ocultan precisamente ese tipo de información.
Los umbrales por ítem funcionan por separado con 1.000 impresiones, 100 clics y 10 conversiones por cada lado. Es posible tener una conclusión sólida a nivel de informe mientras la mayoría de los SKUs individuales estarían en la etapa de Datos insuficientes. Es el estado estándar de un catálogo de cola larga.
5. Retraso de conversión
Los pedidos llegan después de los clics. El retraso de conversión mantiene alejados los días recientes de la muestra de decisión para que se contabilicen las llegadas tardías. El valor predeterminado es de siete días, y debes especificarlo según el retraso real de atribución de tu plataforma. Una prueba puede llegar a la fecha de finalización y aun así estar En espera por retraso de conversión, lo que significa que el sistema se niega a evaluar un conjunto de datos incompleto.
6. Guardarraíles
Los guardarraíles controlan el ROAS, la tasa de conversión, el CPC y el valor por clic mientras se ejecuta la métrica principal. El fallo de un guardarraíl prohibirá que una versión probada gane. Un ejemplo típico es cambiar un título que aumenta el CTR en un 12% pero disminuye la tasa de conversión en un 20%. La métrica principal está bien, pero el guardarraíl detecta el problema y te da un veredicto de Guardarraíl fallido en lugar de Probada está ganando.
Los guardarraíles no impiden que la versión original gane. Mantener lo que ya tienes no supone riesgos adicionales para ti.
Veredictos posibles
- Probada está ganando
- Original está ganando
- Aún no hay decisión
- Recopilando datos
- En espera por duración mínima
- En espera por exposición
- En espera por retraso de conversión
- Guardarraíl fallido
- Datos insuficientes
Siete de nueve veredictos son la negativa a tomar una decisión. Esta proporción es el objetivo. "No hay ganador" es un resultado experimental válido, y una herramienta de pruebas que siempre produce un ganador es inútil.
Decisiones de producto: qué SKUs realmente mejoraron
Las victorias de producto no siempre son universales dentro de una prueba, solo lo suficientemente positivas en conjunto.
La pestaña Decisiones de producto analiza productos individuales por separado del análisis agregado, ya sea a nivel de padre con métricas de variantes consolidadas o como pares individuales de variante padre-original a padre-probada. Cada fila incluye un ganador, una puntuación de confianza, un porcentaje de lift, las métricas reales, un estado, una evaluación de guardarraíl y si califica o no como instantánea. Profundiza en una fila para ver las métricas base tanto de original como de probada, su ratio, el umbral específico usado para el estado y el historial de decisiones.
Es aquí donde ocurren los despliegues selectivos. Simplemente aplica el título de prueba ganador a los 340 productos en los que ganó y deja los otros productos como están.
Del veredicto al feed en vivo
Una prueba ganadora no toca tu feed. La publicación pasa por tres pasos revisados.
- Instantánea. Decide qué pruebas deben desplegarse con la ayuda de Implementar ganadores probados para un despliegue selectivo, Guardar decisiones ganadoras del original para registrar lo que ha funcionado, o Aplicar decisión de todo el informe, si un experimento se planificó como una única decisión para todas las personas.
- Vista previa. Cada diálogo de instantánea realiza primero una ejecución en seco. Informa sobre el número de unidades evaluadas, calificadas, ganadores y su estado, unidades no atribuibles y una muestra de filas que escribe. Las unidades que no pueden atribuir no contienen valores de campo capturados para el lado seleccionado, por lo tanto se omitirán al guardar. Considera esas filas antes de guardarlas.
- Override. Las filas calificadas se guardan en un Shared Override. Aplicar un override a un feed es un paso separado del mapeo del feed, con su propia etapa de vista previa. Los ítems que no estén presentes en un override conservarán su valor del feed.
Vale la pena mencionar dos opciones. Los valores a guardar son independientes del filtro de ganador: el primero determina qué filas califican, y el segundo qué valores del lado se escriben.
Cada despliegue es siempre auditable y se puede deshacer. En caso de un feed importante, usa la vista previa del feed antes de desplegarlo en el feed en vivo.
Feedoptimise frente a otros enfoques de pruebas de feeds
Debe señalarse que no todas las funciones de pruebas A/B ofrecen las mismas capacidades de prueba.
El proceso de pruebas de feed, que está muy difundido y es conocido, incluye cuatro pasos idénticos: división de productos en segmentos, cambio de contenido, recopilación de datos de rendimiento, comparación de métricas. Feedoptimise hace todos los pasos mencionados arriba y va más allá: toma la decisión final.
| Capacidad | Google Product Data Experiments | Pruebas A/B típicas de herramientas de feed | Pruebas A/B de Feedoptimise |
| Campos testeables | Títulos e imágenes | Principalmente títulos | Cualquier campo de salida |
| Canales medidos | Google Shopping y PMax | Varía | Cualquier canal al que sirva tu feed |
| Diseño de prueba | División de tráfico simultánea | Normalmente simultánea | Duplicada o rotativa |
| Pruebas rotativas con el mismo ID | No | Varía | Sí, programadas |
| Rotación por volumen de rendimiento | No | Rara | Sí, en cualquier métrica aditiva |
| Fuentes de datos | Google | Conectadas a la plataforma | Google Ads, GA, GMC, Shopify,
WooCommerce, Magento, Centra,
Facebook, informes personalizados |
| Objetivo principal fijado de antemano | No | Básico | Sí, seis métricas disponibles |
| Intervalo de confianza del lift | No se muestra | Raro | Sí, remuestreado a partir de datos diarios |
| Manejo del retraso de conversión | Interno | Raro | Sí, 7 días por defecto |
| Guardarraíles de métricas secundarias | No | Raro | Sí, en ROAS, CVR, CPC, valor por clic |
| Modos de rigurosidad | No | Raro | Estándar y estricto |
| Veredicto explícito de sin ganador | No documentado | Raro | Sí, siete estados distintos de negativa |
| Veredictos por SKU | No | Raro | Sí, para CTR y tasa de conversión |
| Cronología de decisión a lo largo de la prueba | No | No | Sí, lift y límites del intervalo por día |
| Vista previa de ejecución en seco antes de escribir nada | No | Raro | Sí, en cada instantánea |
| Despliegue selectivo por ítem | Aplicar variante a todos | Raro | Sí, mediante Shared Override |
Deja de adivinar. Empieza a probar.
La optimización de feeds no debería detenerse una vez que se crea un título, una imagen o un atributo: aquí es donde comienzan las pruebas.
Con las pruebas A/B de Feedoptimise, minoristas y agencias pueden contrastar sus datos de producto con la realidad, verificar si los cambios tienen suficiente mérito detrás y transformar de forma segura ganadores calificados en victorias reales de optimización de feeds.