Feedoptimise
Feedoptimise
menu
Essayer Réserver démo

Tests A/B statistiquement significatifs pour les flux produits

Mesurer si les efforts d’optimisation en valaient la peine a toujours été l’un des plus grands défis de l’optimisation des flux produits. Ajuster un titre de produit, reformuler une description de produit à l’aide de l’IA, changer une image ou réorganiser des attributs produit est assez facile. Savoir si le changement a réellement amélioré les performances commerciales, ou si cela n’en a seulement eu l’air, est plus difficile.

C’est la question à laquelle la suite de tests A/B Feedoptimise a été conçue pour répondre.

Intégrée directement au système de gestion de flux produits Feedoptimise, la suite de tests A/B intègre le processus de transformation du flux, l’exécution d’expériences, la collecte de données de performance au niveau de l’article, la prise de décision sur cette base et l’implémentation des gagnants en un seul flux de travail fluide.

Contrairement au simple fait de diviser les produits en deux segments et de déterminer lequel des deux a produit les meilleurs résultats en termes de CTR, de taux de conversion ou de ROAS, Feedoptimise décide si la différence est suffisamment statistiquement significative pour trancher sur la variation gagnante.

Le moteur de décision de Feedoptimise prend en compte des facteurs tels que la confiance statistique, les intervalles de confiance, le lift minimum, la taille d’échantillon, la durée de l’expérience, le délai de conversion et les garde-fous de performance lors de la sélection du gagnant.

Une fois les preuves disponibles, la variation gagnante est ensuite réinjectée dans le flux via un processus d’implémentation contrôlé et prévisualisable.

C’est une approche entièrement nouvelle de l’optimisation des flux produits, puisque les marchands n’ont pas à effectuer un changement en espérant qu’il paiera, mais peuvent plutôt tester l’hypothèse et implémenter des changements étayés par des résultats réels.

Ce que comprend la dernière version

  • Tests sur n’importe quel champ du flux. Titres, descriptions, types de produits, catégories, images, tout attribut de sortie dans votre mapping de flux.
  • Deux conceptions d’expérience. Test en duplication avec les deux côtés exécutés simultanément avec des ID d’article différents. Test en rotation avec un seul ID d’article et alternance de l’ensemble de la population par phases.
  • Vos propres données de performance. Connectez Google Ads, Google Analytics, Google Merchant Center, Shopify, WooCommerce, Magento, Centra, Facebook ou un rapport personnalisé.
  • Un moteur de décision avec des paramètres par défaut. 95% de confiance, 5% de lift minimum, 14 jours minimum, 5 000 impressions, 300 clics et 30 conversions par côté, un délai de conversion de 7 jours et une durée maximale de 60 jours.
  • Verdicts par article. Un tableau indiquant quels produits individuels ont accumulé suffisamment de preuves pour agir, séparément du résultat global.
  • Un parcours d’implémentation révisé. Les gagnants sont ajoutés au Shared Override via un instantané préalablement révisé. Aucun changement ne sera apporté à votre flux en direct sans votre approbation.

Pourquoi la significativité statistique compte dans les tests de flux

Les flux fonctionnent dans l’enchère. Les volumes de trafic fluctuent selon le jour de la semaine, les enchères des concurrents, le rythme du budget, la saisonnalité et les mises à jour de l’algorithme Google. Dans ce contexte, une différence de CTR de 4% entre deux formats de titre ne représente pas un signal notable pour la plupart des catalogues.

Pourtant, des décisions sont prises sur la base de ces différences. On déploie un format de titre sur 40 000 SKU, on attend un trimestre pendant que la performance dérive, et on ne sait pas si cela a eu un impact. Cette décision a un coût : l’effort de déploiement gaspillé, mais surtout la mauvaise hypothèse qui sera ensuite réutilisée dans les tests suivants.

Il y a trois causes principales d’erreur ici.

  1. Lire un résultat avant que l’information ne soit là. Les recommandations pour exécuter des tests de flux complémentaires d’optimisation des titres indiquent souvent qu’environ 100 clics suffisent comme point de données pour tirer des conclusions sur la tendance. C’est suffisant pour le CTR. Ce n’est absolument pas suffisant pour tirer des conclusions sur un taux de conversion ou un ROAS, et c’est ainsi que la plupart des équipes flux perdent de l’argent.
  2. Optimiser une métrique sur le terrain d’une autre métrique. Ajouter « Black Friday » et « Free Gift » à un titre et le CTR explose. Cependant, le taux de conversion et le ROAS peuvent s’effondrer, car le titre a attiré sur le site des visiteurs qui n’achètent pas. Une optimisation de titre focalisée sur une seule métrique déclarera ici une fausse victoire.
  3. Arrêter le test quand le chiffre a l’air bon. Des vérifications quotidiennes du tableau de bord suivies de l’arrêt du test dès qu’il atteint un pic à la hausse créent de nombreux faux positifs. Les premiers résultats de lift du test proviennent d’une marche aléatoire. Arrêtez au sommet du lift et vous mesurez le sommet du lift.

Feedoptimise prend en charge chacun de ces points en tant qu’élément structurel intégré.

Deux méthodes expérimentales : tests en duplication et en rotation

Comme les différents canaux e-commerce impliquent des restrictions différentes pour les expériences, Feedoptimise emploie deux méthodologies de test différentes.

1. Test A/B en duplication

Lors d’une expérience en duplication, Feedoptimise publie :

A - l’ancien produit, avec le même ancien ID et les anciennes valeurs.
B - un produit dupliqué, avec un nouvel ID prévisible et de nouvelles valeurs testées.

En conséquence, les deux variantes peuvent collecter des données de performance en même temps.

La comparaison simultanée de l’expérience sera possible lorsque la destination accepte les deux ID produit et peut diriger le trafic vers les deux versions.

Par exemple :

Old ID: 34130964
Old Title: Running Shoes
New ID: M-34130964
New Title: Men's Lightweight Running Shoes

Les deux produits sont en concurrence sur la même période, Feedoptimise attribuant les résultats de l’expérience.

2. Test A/B en rotation

Il existe des destinations où les produits dupliqués ne peuvent pas exister.

Dans ce cas, Feedoptimise pourra conserver le même ID pour l’expérience mais le faire alterner entre les anciennes et les nouvelles valeurs.

La première phase peut utiliser l’ancienne version de l’expérience. Puis vient la nouvelle version.

Feedoptimise propose d’effectuer des rotations soit dans le temps, soit en fonction d’un volume de métriques accumulé (par exemple, les impressions).

Les rotations basées sur un volume de métriques accumulé sont particulièrement précieuses, car l’expérience peut alterner en fonction d’une quantité d’exposition collectée approximativement égale.

Connecter les expériences à de vraies données de performance

Feedoptimise relie les expériences à des sources de reporting au niveau de l’article, qui incluent :

Des plateformes publicitaires, des plateformes d’analytics, des plateformes e-commerce et des fichiers de reporting personnalisés.

Selon la configuration du compte, les sources de reporting peuvent inclure :

Google Ads, Google Analytics, Google Merchant Center, reporting Facebook/Meta, Shopify, WooCommerce, Magento, et des rapports personnalisés basés sur URL.

Processus de prise de décision

Il y a six facteurs entre « la ligne testée est plus haute » et « testée gagne ».

1. D’abord, une métrique principale est sélectionnée à l’avance

Choisissez une métrique qui correspond à l’hypothèse : ROAS, valeur par clic, valeur par conversion, taux de conversion ou CTR. L’algorithme de sélection automatique privilégie les métriques basées sur le ROAS au niveau du rapport. La sélection a posteriori d’une métrique qui favorise la variante est la manière dont les équipes génèrent artificiellement des victoires.

Feedoptimise les calcule à partir des rôles additifs sous-jacents. Le mapping de vos colonnes source se fait selon cinq rôles sémantiques :

Rôle sémantique :
Colonnes source typiques :
Exposition / impressions
impressions, views
Clics / visites
clicks, sessions
Conversions / résultats
conversions, orders
Coût / dépenses
cost, ad_spend
Valeur de conversion / chiffre d’affaires
conv_value, revenue

À partir de ceux-ci, le moteur extrait le CTR, le taux de conversion, le CPC, le ROAS, la valeur par clic et la valeur par conversion. C’est le mapping des quantités en nombres qui permet d’effectuer un rééchantillonnage valide.

2. Un intervalle de confiance, pas seulement un chiffre

Effectuez un test pendant deux semaines et vous obtenez un seul chiffre : la version testée a fait 8% de mieux. Effectuez le test pendant deux semaines supplémentaires et il donne une réponse différente, car les clics et les conversions ne sont pas répartis de manière égale.

Feedoptimise analyse cette incertitude. Le moteur répète votre test des milliers de fois sur vos données quotidiennes réelles, de toutes les manières possibles, et vous donne un intervalle dans lequel le lift réel peut se situer.

Observed lift:   +8%
95% CI:          +2% to +14%

Toutes les valeurs de cet intervalle sont positives, donc la version testée gagne.

Observed lift:    +8%
95% CI:           -3% to +18%

Même titre. Cet intervalle contient zéro ; la différence pourrait donc être de +18% comme de -3% et vos données ne vous permettent pas de distinguer entre les deux. La conclusion reste non concluante.

Le niveau de confiance signifie à quel point les données sont fiables pour confirmer une certaine direction de différence. Ce n’est pas la probabilité du profit du déploiement.

3. Votre lift minimum prédéfini à l’avance

La significativité statistique et la pertinence pratique sont deux concepts différents. Il pourrait y avoir un lift de 0,4% en ROAS, réel mais pas assez précieux pour être implémenté à l’échelle du catalogue. Le lift minimum par défaut est de 5%. Le niveau de rigueur standard demande de dépasser zéro et le lift minimum. Le réglage strict exige que l’intervalle entier soit au-dessus du seuil de lift minimum.

4. Des seuils d’échantillon des deux côtés

Les valeurs par défaut sont 5 000 impressions, 300 clics et 30 conversions par côté, et 14 jours minimum.

Par côté, cela fait une différence. Si un rapport indique 10 000 impressions, cela semble bon jusqu’à ce que vous voyiez que 9 200 impressions appartiennent à l’ensemble d’annonces original. Le seuil sera correctement maintenu au statut En attente. Les chiffres agrégés masquent précisément ce type d’information.

Les seuils par article fonctionnent séparément avec 1 000 impressions, 100 clics et 10 conversions par côté. Il est possible d’avoir une conclusion solide au niveau du rapport alors que la plupart des SKU individuels seraient au stade Données insuffisantes. C’est l’état standard d’un catalogue à longue traîne.

5. Délai de conversion

Les commandes arrivent après les clics. Le délai de conversion écarte les jours récents de l’échantillon de décision afin que les arrivées tardives soient prises en compte. La valeur par défaut est de sept jours, et vous devez la spécifier en fonction du délai d’attribution réel de votre plateforme. Un test peut atteindre la date de fin et être encore En attente du délai de conversion, ce qui signifie que le système refuse d’évaluer un jeu de données incomplet.

6. Garde-fous

Les garde-fous contrôlent le ROAS, le taux de conversion, le CPC et la valeur par clic pendant l’exécution de la métrique principale. L’échec d’un garde-fou empêchera la version testée de gagner. Un exemple typique est la modification d’un titre qui augmente le CTR de 12% mais diminue le taux de conversion de 20%. La métrique principale est bonne, mais le garde-fou détecte le problème et vous donne un verdict Garde-fou échoué au lieu de La version testée gagne.

Les garde-fous n’empêchent pas la version originale de gagner. Conserver ce que vous avez déjà ne pose aucun risque supplémentaire pour vous.

Verdicts possibles

  • La version testée gagne
  • La version originale gagne
  • Pas encore de décision
  • Collecte de données
  • En attente de la durée minimale
  • En attente d’exposition
  • En attente du délai de conversion
  • Garde-fou échoué
  • Données insuffisantes

Sept verdicts sur neuf sont un refus de prendre une décision. Ce ratio est l’objectif. « Il n’y a pas de gagnant » est un résultat expérimental valide, et un outil de test qui produit toujours un gagnant est inutile.

Décisions produit : quels SKU se sont réellement améliorés

Les gains produit ne sont pas toujours universels sur un test, seulement suffisamment positifs dans l’ensemble.

L’onglet Décisions produit analyse les produits individuels séparément de l’analyse agrégée, soit au niveau parent avec des métriques de variantes agrégées, soit en tant que paires parent-original à parent-variante testée. Chaque ligne inclut un gagnant, un score de confiance, un pourcentage de lift, les métriques réelles, un statut, une évaluation des garde-fous et si cela se qualifie comme un instantané. Ouvrez le détail d’une ligne pour voir les métriques de base pour l’original et la version testée, leur ratio, le seuil spécifique utilisé pour le statut et l’historique de décision.

C’est ici que les déploiements sélectifs ont lieu. Appliquez simplement le titre de test gagnant aux 340 produits pour lesquels il a gagné et laissez les autres produits tels quels.

Du verdict au flux en direct

Un test gagnant ne touche pas à votre flux. La publication passe par trois étapes révisées.

  1. Instantané. Décidez quels tests doivent être déployés à l’aide de Implémenter les gagnants testés pour un déploiement sélectif, Enregistrer les décisions gagnantes de l’original pour consigner ce qui a fonctionné, ou Appliquer la décision de l’ensemble du rapport, si une expérience a été planifiée comme une décision unique pour tout le monde.
  2. Aperçu. Chaque boîte de dialogue d’instantané effectue d’abord une exécution à blanc. Elle informe du nombre d’unités évaluées, qualifiées, des gagnants et de leur statut, des unités non attribuables et d’un échantillon des lignes écrites. Les unités qui ne peuvent pas être attribuées ne contiennent pas les valeurs de champ capturées pour le côté sélectionné ; elles seront donc ignorées lors de l’enregistrement. Examinez ces lignes avant de les enregistrer.
  3. Override. Les lignes qualifiées sont enregistrées dans un Shared Override. L’application d’un override à un flux est une étape distincte du mapping de flux, avec sa propre étape d’aperçu. Les articles qui ne sont pas présents dans un override conserveront leur valeur de flux.

Deux options méritent d’être mentionnées. Les valeurs à enregistrer sont indépendantes du filtre de gagnant : la première détermine quelles lignes sont qualifiées, et le second quelles valeurs du côté sont écrites.

Chaque déploiement est toujours auditable et peut être annulé. En cas de flux important, utilisez l’aperçu du flux avant de le déployer dans le flux en direct.

Feedoptimise versus d’autres approches de test de flux

Il convient de noter que toutes les fonctionnalités de test A/B n’offrent pas les mêmes capacités de test.

Le processus de test de flux, largement médiatisé et connu, comprend quatre étapes identiques : division des produits en segments, modification du contenu, collecte des données de performance, comparaison des métriques. Feedoptimise réalise toutes les étapes mentionnées ci-dessus et va plus loin : il prend la décision finale.

Capacité
Google Product Data Experiments
Test A/B typique d’un outil de flux
Tests A/B Feedoptimise
Champs testables
Titres et images
Principalement les titres
N’importe quel champ de sortie
Canaux mesurés
Google Shopping et PMax
Varie
N’importe quel canal servi par votre flux
Conception du test
Répartition simultanée du trafic
Généralement simultané
En duplication ou en rotation
Test en rotation avec le même ID
Non
Varie
Oui, planifié
Rotation par volume de performance
Non
Rare
Oui, sur toute métrique additive
Sources de données
Google
Connecté à la plateforme
Google Ads, GA, GMC, Shopify, WooCommerce, Magento, Centra, Facebook, rapports personnalisés
Objectif principal fixé à l’avance
NonBasique
Oui, six métriques disponibles
Intervalle de confiance sur le lift
Non exposé
Rare
Oui, rééchantillonné à partir des données quotidiennes
Gestion du délai de conversion
InterneRare
Oui, 7 jours par défaut
Garde-fous sur les métriques secondaires
Non
Rare
Oui, sur ROAS, CVR, CPC, valeur par clic
Modes de rigueur
Non
Rare
Standard et Strict
Verdict explicite sans gagnant
Non documenté
Rare
Oui, sept états distincts de refus
Verdicts par SKU
Non
Rare
Oui, pour le CTR et le taux de conversion
Chronologie de décision tout au long du test
Non
NonOui, lift et bornes d’intervalle par jour
Aperçu en exécution à blanc avant toute écriture
Non
Rare
Oui, sur chaque instantané
Déploiement sélectif par article
Appliquer la variante à tous
Rare
Oui, via Shared Override


Arrêtez de deviner. Commencez à tester.

L’optimisation des flux ne devrait pas s’arrêter une fois qu’un titre, une image ou un attribut est créé — c’est là que les tests commencent.

Avec les tests A/B Feedoptimise, les détaillants et les agences peuvent confronter leurs données produit à la réalité, vérifier si les changements ont suffisamment de mérite, et transformer en toute sécurité les gagnants qualifiés en véritables gains d’optimisation de flux.

Commencez votre essai gratuit ou Réservez une démo

Foire aux questions

  • Qu’est-ce qu’un test A/B statistiquement significatif pour les flux produits ?

    Un test A/B statistiquement significatif pour les flux produits est un flux de travail expérimental où des variantes de flux sont testées sur du trafic réel et un moteur de décision vérifie les intervalles de confiance, le lift minimum, la taille d’échantillon, la durée, le délai de conversion et les garde-fous avant de déclarer une version gagnante ou de refuser de décider.

  • Comment les tests A/B Feedoptimise améliorent-ils l’optimisation des flux produits ?

    Les tests A/B Feedoptimise permettent aux marchands de tester n’importe quel champ du flux, de connecter de vraies données de performance, d’exécuter des expériences en duplication ou en rotation, et d’utiliser un moteur de décision pour déployer uniquement des gagnants statistiquement prouvés au lieu de s’appuyer sur l’intuition ou sur des différences de CTR bruitées.

  • Quelle est la différence entre les tests A/B en duplication et en rotation dans les flux produits ?

    Le test A/B en duplication crée un second produit avec un nouvel ID afin que les deux variantes s’exécutent simultanément, tandis que le test A/B en rotation conserve le même ID et alterne les anciennes et nouvelles valeurs dans le temps ou selon le volume d’impressions lorsqu’un canal n’autorise pas les produits dupliqués.

  • Quelles métriques et quelles sources de données Feedoptimise peut-il utiliser pour les tests A/B de flux ?

    Feedoptimise peut utiliser des données au niveau de l’article provenant de Google Ads, Google Analytics, Google Merchant Center, Facebook, Shopify, WooCommerce, Magento, Centra et de rapports personnalisés, et optimiser pour le ROAS, la valeur par clic, la valeur par conversion, le taux de conversion ou le CTR avec des garde-fous sur le ROAS, le CVR, le CPC et la valeur par clic.

  • Pourquoi la significativité statistique est-elle importante dans les tests de flux produits ?

    La significativité statistique empêche les équipes flux d’agir sur des fluctuations aléatoires du CTR, du taux de conversion ou du ROAS causées par les enchères, la saisonnalité et le rythme du budget, réduisant les faux positifs dus à des pics précoces, à des échantillons sous-dimensionnés et à des optimisations mono-métrique qui nuisent à la rentabilité.

  • Comment le moteur de décision Feedoptimise détermine-t-il une variante de flux gagnante ?

    Le moteur de décision présélectionne une métrique principale, construit des intervalles de confiance sur le lift, applique des seuils de lift minimum, des seuils d’échantillon, un délai de conversion et des garde-fous, puis émet des verdicts tels que La version testée gagne, La version originale gagne, Garde-fou échoué ou plusieurs états sans décision lorsque les preuves sont insuffisantes.

  • Comment puis-je déployer les résultats gagnants d’un test A/B sur mon flux produits en direct ?

    Feedoptimise utilise un déploiement en trois étapes : créer un instantané des gagnants, exécuter un aperçu en exécution à blanc montrant les articles qualifiés et des exemples de lignes, puis enregistrer les changements dans un Shared Override qui peut être appliqué de manière sélective dans le mapping de flux, garantissant que chaque déploiement est révisable et réversible.