Mesurer si les efforts d’optimisation en valaient la peine a toujours été l’un des plus grands défis de l’optimisation des flux produits. Ajuster un titre de produit, reformuler une description de produit à l’aide de l’IA, changer une image ou réorganiser des attributs produit est assez facile. Savoir si le changement a réellement amélioré les performances commerciales, ou si cela n’en a seulement eu l’air, est plus difficile.
C’est la question à laquelle la suite de tests A/B Feedoptimise a été conçue pour répondre.
Intégrée directement au système de gestion de flux produits Feedoptimise, la suite de tests A/B intègre le processus de transformation du flux, l’exécution d’expériences, la collecte de données de performance au niveau de l’article, la prise de décision sur cette base et l’implémentation des gagnants en un seul flux de travail fluide.
Contrairement au simple fait de diviser les produits en deux segments et de déterminer lequel des deux a produit les meilleurs résultats en termes de CTR, de taux de conversion ou de ROAS, Feedoptimise décide si la différence est suffisamment statistiquement significative pour trancher sur la variation gagnante.
Le moteur de décision de Feedoptimise prend en compte des facteurs tels que la confiance statistique, les intervalles de confiance, le lift minimum, la taille d’échantillon, la durée de l’expérience, le délai de conversion et les garde-fous de performance lors de la sélection du gagnant.
Une fois les preuves disponibles, la variation gagnante est ensuite réinjectée dans le flux via un processus d’implémentation contrôlé et prévisualisable.
C’est une approche entièrement nouvelle de l’optimisation des flux produits, puisque les marchands n’ont pas à effectuer un changement en espérant qu’il paiera, mais peuvent plutôt tester l’hypothèse et implémenter des changements étayés par des résultats réels.
Ce que comprend la dernière version
- Tests sur n’importe quel champ du flux. Titres, descriptions, types de produits, catégories, images, tout attribut de sortie dans votre mapping de flux.
- Deux conceptions d’expérience. Test en duplication avec les deux côtés exécutés simultanément avec des ID d’article différents. Test en rotation avec un seul ID d’article et alternance de l’ensemble de la population par phases.
- Vos propres données de performance. Connectez Google Ads, Google Analytics, Google Merchant Center, Shopify, WooCommerce, Magento, Centra, Facebook ou un rapport personnalisé.
- Un moteur de décision avec des paramètres par défaut. 95% de confiance, 5% de lift minimum, 14 jours minimum, 5 000 impressions, 300 clics et 30 conversions par côté, un délai de conversion de 7 jours et une durée maximale de 60 jours.
- Verdicts par article. Un tableau indiquant quels produits individuels ont accumulé suffisamment de preuves pour agir, séparément du résultat global.
- Un parcours d’implémentation révisé. Les gagnants sont ajoutés au Shared Override via un instantané préalablement révisé. Aucun changement ne sera apporté à votre flux en direct sans votre approbation.
Pourquoi la significativité statistique compte dans les tests de flux
Les flux fonctionnent dans l’enchère. Les volumes de trafic fluctuent selon le jour de la semaine, les enchères des concurrents, le rythme du budget, la saisonnalité et les mises à jour de l’algorithme Google. Dans ce contexte, une différence de CTR de 4% entre deux formats de titre ne représente pas un signal notable pour la plupart des catalogues.
Pourtant, des décisions sont prises sur la base de ces différences. On déploie un format de titre sur 40 000 SKU, on attend un trimestre pendant que la performance dérive, et on ne sait pas si cela a eu un impact. Cette décision a un coût : l’effort de déploiement gaspillé, mais surtout la mauvaise hypothèse qui sera ensuite réutilisée dans les tests suivants.
Il y a trois causes principales d’erreur ici.
- Lire un résultat avant que l’information ne soit là. Les recommandations pour exécuter des tests de flux complémentaires d’optimisation des titres indiquent souvent qu’environ 100 clics suffisent comme point de données pour tirer des conclusions sur la tendance. C’est suffisant pour le CTR. Ce n’est absolument pas suffisant pour tirer des conclusions sur un taux de conversion ou un ROAS, et c’est ainsi que la plupart des équipes flux perdent de l’argent.
- Optimiser une métrique sur le terrain d’une autre métrique. Ajouter « Black Friday » et « Free Gift » à un titre et le CTR explose. Cependant, le taux de conversion et le ROAS peuvent s’effondrer, car le titre a attiré sur le site des visiteurs qui n’achètent pas. Une optimisation de titre focalisée sur une seule métrique déclarera ici une fausse victoire.
- Arrêter le test quand le chiffre a l’air bon. Des vérifications quotidiennes du tableau de bord suivies de l’arrêt du test dès qu’il atteint un pic à la hausse créent de nombreux faux positifs. Les premiers résultats de lift du test proviennent d’une marche aléatoire. Arrêtez au sommet du lift et vous mesurez le sommet du lift.
Feedoptimise prend en charge chacun de ces points en tant qu’élément structurel intégré.
Deux méthodes expérimentales : tests en duplication et en rotation
Comme les différents canaux e-commerce impliquent des restrictions différentes pour les expériences, Feedoptimise emploie deux méthodologies de test différentes.
1. Test A/B en duplication
Lors d’une expérience en duplication, Feedoptimise publie :
A - l’ancien produit, avec le même ancien ID et les anciennes valeurs.
B - un produit dupliqué, avec un nouvel ID prévisible et de nouvelles valeurs testées.
En conséquence, les deux variantes peuvent collecter des données de performance en même temps.
La comparaison simultanée de l’expérience sera possible lorsque la destination accepte les deux ID produit et peut diriger le trafic vers les deux versions.
Par exemple :
Old ID: 34130964
Old Title: Running Shoes
New ID: M-34130964
New Title: Men's Lightweight Running Shoes
Les deux produits sont en concurrence sur la même période, Feedoptimise attribuant les résultats de l’expérience.
2. Test A/B en rotation
Il existe des destinations où les produits dupliqués ne peuvent pas exister.
Dans ce cas, Feedoptimise pourra conserver le même ID pour l’expérience mais le faire alterner entre les anciennes et les nouvelles valeurs.
La première phase peut utiliser l’ancienne version de l’expérience. Puis vient la nouvelle version.
Feedoptimise propose d’effectuer des rotations soit dans le temps, soit en fonction d’un volume de métriques accumulé (par exemple, les impressions).
Les rotations basées sur un volume de métriques accumulé sont particulièrement précieuses, car l’expérience peut alterner en fonction d’une quantité d’exposition collectée approximativement égale.
Connecter les expériences à de vraies données de performance
Feedoptimise relie les expériences à des sources de reporting au niveau de l’article, qui incluent :
Des plateformes publicitaires, des plateformes d’analytics, des plateformes e-commerce et des fichiers de reporting personnalisés.
Selon la configuration du compte, les sources de reporting peuvent inclure :
Google Ads, Google Analytics, Google Merchant Center, reporting Facebook/Meta, Shopify, WooCommerce, Magento, et des rapports personnalisés basés sur URL.
Processus de prise de décision
Il y a six facteurs entre « la ligne testée est plus haute » et « testée gagne ».
1. D’abord, une métrique principale est sélectionnée à l’avance
Choisissez une métrique qui correspond à l’hypothèse : ROAS, valeur par clic, valeur par conversion, taux de conversion ou CTR. L’algorithme de sélection automatique privilégie les métriques basées sur le ROAS au niveau du rapport. La sélection a posteriori d’une métrique qui favorise la variante est la manière dont les équipes génèrent artificiellement des victoires.
Feedoptimise les calcule à partir des rôles additifs sous-jacents. Le mapping de vos colonnes source se fait selon cinq rôles sémantiques :
| Rôle sémantique : | Colonnes source typiques : |
| Exposition / impressions | impressions, views |
| Clics / visites | clicks, sessions |
| Conversions / résultats | conversions, orders |
| Coût / dépenses | cost, ad_spend |
| Valeur de conversion / chiffre d’affaires | conv_value, revenue |
À partir de ceux-ci, le moteur extrait le CTR, le taux de conversion, le CPC, le ROAS, la valeur par clic et la valeur par conversion. C’est le mapping des quantités en nombres qui permet d’effectuer un rééchantillonnage valide.
2. Un intervalle de confiance, pas seulement un chiffre
Effectuez un test pendant deux semaines et vous obtenez un seul chiffre : la version testée a fait 8% de mieux. Effectuez le test pendant deux semaines supplémentaires et il donne une réponse différente, car les clics et les conversions ne sont pas répartis de manière égale.
Feedoptimise analyse cette incertitude. Le moteur répète votre test des milliers de fois sur vos données quotidiennes réelles, de toutes les manières possibles, et vous donne un intervalle dans lequel le lift réel peut se situer.
Observed lift: +8%
95% CI: +2% to +14%
Toutes les valeurs de cet intervalle sont positives, donc la version testée gagne.
Observed lift: +8%
95% CI: -3% to +18%
Même titre. Cet intervalle contient zéro ; la différence pourrait donc être de +18% comme de -3% et vos données ne vous permettent pas de distinguer entre les deux. La conclusion reste non concluante.
Le niveau de confiance signifie à quel point les données sont fiables pour confirmer une certaine direction de différence. Ce n’est pas la probabilité du profit du déploiement.
3. Votre lift minimum prédéfini à l’avance
La significativité statistique et la pertinence pratique sont deux concepts différents. Il pourrait y avoir un lift de 0,4% en ROAS, réel mais pas assez précieux pour être implémenté à l’échelle du catalogue. Le lift minimum par défaut est de 5%. Le niveau de rigueur standard demande de dépasser zéro et le lift minimum. Le réglage strict exige que l’intervalle entier soit au-dessus du seuil de lift minimum.
4. Des seuils d’échantillon des deux côtés
Les valeurs par défaut sont 5 000 impressions, 300 clics et 30 conversions par côté, et 14 jours minimum.
Par côté, cela fait une différence. Si un rapport indique 10 000 impressions, cela semble bon jusqu’à ce que vous voyiez que 9 200 impressions appartiennent à l’ensemble d’annonces original. Le seuil sera correctement maintenu au statut En attente. Les chiffres agrégés masquent précisément ce type d’information.
Les seuils par article fonctionnent séparément avec 1 000 impressions, 100 clics et 10 conversions par côté. Il est possible d’avoir une conclusion solide au niveau du rapport alors que la plupart des SKU individuels seraient au stade Données insuffisantes. C’est l’état standard d’un catalogue à longue traîne.
5. Délai de conversion
Les commandes arrivent après les clics. Le délai de conversion écarte les jours récents de l’échantillon de décision afin que les arrivées tardives soient prises en compte. La valeur par défaut est de sept jours, et vous devez la spécifier en fonction du délai d’attribution réel de votre plateforme. Un test peut atteindre la date de fin et être encore En attente du délai de conversion, ce qui signifie que le système refuse d’évaluer un jeu de données incomplet.
6. Garde-fous
Les garde-fous contrôlent le ROAS, le taux de conversion, le CPC et la valeur par clic pendant l’exécution de la métrique principale. L’échec d’un garde-fou empêchera la version testée de gagner. Un exemple typique est la modification d’un titre qui augmente le CTR de 12% mais diminue le taux de conversion de 20%. La métrique principale est bonne, mais le garde-fou détecte le problème et vous donne un verdict Garde-fou échoué au lieu de La version testée gagne.
Les garde-fous n’empêchent pas la version originale de gagner. Conserver ce que vous avez déjà ne pose aucun risque supplémentaire pour vous.
Verdicts possibles
- La version testée gagne
- La version originale gagne
- Pas encore de décision
- Collecte de données
- En attente de la durée minimale
- En attente d’exposition
- En attente du délai de conversion
- Garde-fou échoué
- Données insuffisantes
Sept verdicts sur neuf sont un refus de prendre une décision. Ce ratio est l’objectif. « Il n’y a pas de gagnant » est un résultat expérimental valide, et un outil de test qui produit toujours un gagnant est inutile.
Décisions produit : quels SKU se sont réellement améliorés
Les gains produit ne sont pas toujours universels sur un test, seulement suffisamment positifs dans l’ensemble.
L’onglet Décisions produit analyse les produits individuels séparément de l’analyse agrégée, soit au niveau parent avec des métriques de variantes agrégées, soit en tant que paires parent-original à parent-variante testée. Chaque ligne inclut un gagnant, un score de confiance, un pourcentage de lift, les métriques réelles, un statut, une évaluation des garde-fous et si cela se qualifie comme un instantané. Ouvrez le détail d’une ligne pour voir les métriques de base pour l’original et la version testée, leur ratio, le seuil spécifique utilisé pour le statut et l’historique de décision.
C’est ici que les déploiements sélectifs ont lieu. Appliquez simplement le titre de test gagnant aux 340 produits pour lesquels il a gagné et laissez les autres produits tels quels.
Du verdict au flux en direct
Un test gagnant ne touche pas à votre flux. La publication passe par trois étapes révisées.
- Instantané. Décidez quels tests doivent être déployés à l’aide de Implémenter les gagnants testés pour un déploiement sélectif, Enregistrer les décisions gagnantes de l’original pour consigner ce qui a fonctionné, ou Appliquer la décision de l’ensemble du rapport, si une expérience a été planifiée comme une décision unique pour tout le monde.
- Aperçu. Chaque boîte de dialogue d’instantané effectue d’abord une exécution à blanc. Elle informe du nombre d’unités évaluées, qualifiées, des gagnants et de leur statut, des unités non attribuables et d’un échantillon des lignes écrites. Les unités qui ne peuvent pas être attribuées ne contiennent pas les valeurs de champ capturées pour le côté sélectionné ; elles seront donc ignorées lors de l’enregistrement. Examinez ces lignes avant de les enregistrer.
- Override. Les lignes qualifiées sont enregistrées dans un Shared Override. L’application d’un override à un flux est une étape distincte du mapping de flux, avec sa propre étape d’aperçu. Les articles qui ne sont pas présents dans un override conserveront leur valeur de flux.
Deux options méritent d’être mentionnées. Les valeurs à enregistrer sont indépendantes du filtre de gagnant : la première détermine quelles lignes sont qualifiées, et le second quelles valeurs du côté sont écrites.
Chaque déploiement est toujours auditable et peut être annulé. En cas de flux important, utilisez l’aperçu du flux avant de le déployer dans le flux en direct.
Feedoptimise versus d’autres approches de test de flux
Il convient de noter que toutes les fonctionnalités de test A/B n’offrent pas les mêmes capacités de test.
Le processus de test de flux, largement médiatisé et connu, comprend quatre étapes identiques : division des produits en segments, modification du contenu, collecte des données de performance, comparaison des métriques. Feedoptimise réalise toutes les étapes mentionnées ci-dessus et va plus loin : il prend la décision finale.
| Capacité | Google Product Data Experiments | Test A/B typique d’un outil de flux | Tests A/B Feedoptimise |
| Champs testables | Titres et images | Principalement les titres | N’importe quel champ de sortie |
| Canaux mesurés | Google Shopping et PMax | Varie | N’importe quel canal servi par votre flux |
| Conception du test | Répartition simultanée du trafic | Généralement simultané | En duplication ou en rotation |
| Test en rotation avec le même ID | Non | Varie | Oui, planifié |
| Rotation par volume de performance | Non | Rare | Oui, sur toute métrique additive |
| Sources de données | Google | Connecté à la plateforme | Google Ads, GA, GMC, Shopify,
WooCommerce, Magento, Centra,
Facebook, rapports personnalisés |
| Objectif principal fixé à l’avance | Non | Basique | Oui, six métriques disponibles |
| Intervalle de confiance sur le lift | Non exposé | Rare | Oui, rééchantillonné à partir des données quotidiennes |
| Gestion du délai de conversion | Interne | Rare | Oui, 7 jours par défaut |
| Garde-fous sur les métriques secondaires | Non | Rare | Oui, sur ROAS, CVR, CPC, valeur par clic |
| Modes de rigueur | Non | Rare | Standard et Strict |
| Verdict explicite sans gagnant | Non documenté | Rare | Oui, sept états distincts de refus |
| Verdicts par SKU | Non | Rare | Oui, pour le CTR et le taux de conversion |
| Chronologie de décision tout au long du test | Non | Non | Oui, lift et bornes d’intervalle par jour |
| Aperçu en exécution à blanc avant toute écriture | Non | Rare | Oui, sur chaque instantané |
| Déploiement sélectif par article | Appliquer la variante à tous | Rare | Oui, via Shared Override |
Arrêtez de deviner. Commencez à tester.
L’optimisation des flux ne devrait pas s’arrêter une fois qu’un titre, une image ou un attribut est créé — c’est là que les tests commencent.
Avec les tests A/B Feedoptimise, les détaillants et les agences peuvent confronter leurs données produit à la réalité, vérifier si les changements ont suffisamment de mérite, et transformer en toute sécurité les gagnants qualifiés en véritables gains d’optimisation de flux.