--- title: "Tout savoir sur l'AB Testing" url: https://www.ouestmedias.net/tout-savoir-sur-lab-testing.html author: "Delphine Macouin" date_published: 2023-08-20T08:01:50+00:00 date_modified: 2026-09-10T15:50:02+00:00 categories: ["Travail"] image: https://www.ouestmedias.net/wp-content/uploads/2022/12/-33-scaled.jpg description: "Détecter un gain de 20 % sur un taux de conversion de 2 % demande environ 20 000 visiteurs par version. La plupart des sites e-commerce français n'atteignent pas ce..." site: "Ouest Médias" license: "Reproduction autorisée avec lien vers la source." --- # Tout savoir sur l'AB Testing Détecter un gain de 20 % sur un taux de conversion de 2 % demande environ 20 000 visiteurs par version. La plupart des sites e-commerce français n'atteignent pas ce volume en un mois. Avant de choisir un outil d'A/B testing, il faut donc répondre à une question désagréable : avez-vous assez de trafic pour que le résultat veuille dire quelque chose ? Le principe, lui, est limpide. On présente deux versions d'une même page à deux moitiés du trafic, tirées au sort, et on compare une métrique définie à l'avance. La version A est l'existant, la version B la modification testée. Au bout d'un certain temps, on regarde laquelle convertit le mieux et on garde la gagnante. Sur le papier, c'est de la méthode expérimentale appliquée au web. **La taille d'échantillon, en clair** Base de conversion à 2 %. Pour détecter un passage à 2,4 % (soit +20 % en relatif) avec 95 % de confiance et 80 % de puissance, comptez environ 20 000 visiteurs par variante, donc 40 000 au total. Pour un gain de 10 % seulement, la note quadruple : près de 80 000 par variante. Diviser l'effet recherché par deux multiplie l'échantillon par quatre. ## Une méthode ancienne, pas une nouveauté On lit souvent que l'A/B testing serait un outil récent. C'est inexact, et l'inexactitude n'est pas anodine : elle laisse croire que la discipline est encore expérimentale alors que ses fondements sont fixés depuis un siècle. Les plans d'expérience randomisés remontent aux travaux du statisticien Ronald Fisher dans les années 1920, sur des parcelles agricoles. Le marketing direct testait déjà deux versions d'un publipostage sur deux listes d'adresses dans les années 1960. Sur le web, Google a mené son premier test grandeur nature en février 2000, en faisant varier le nombre de résultats affichés sur sa page. Amazon, Booking et eBay industrialisent la pratique depuis le milieu des années 2000, avec plusieurs milliers de tests simultanés pour les plus gros. Ce qui est récent, c'est l'accès : les plateformes en libre-service ont mis l'outil à portée d'une PME, sans que le raisonnement statistique suive toujours. ## Ce qu'on mesure, et le piège de la métrique choisie ![Illustration de deux versions d'une page web comparées côte à côte](https://www.ouestmedias.net/wp-content/uploads/2022/12/Vecteur-ab-testing.jpg) *Deux versions, un trafic partagé au hasard, une seule métrique décisive* Il faut fixer avant le lancement la métrique qui tranchera. Taux de conversion, taux de clic, taux d'ajout au panier, panier moyen, revenu par visiteur. Une seule, décidée à l'avance. Si vous en suivez huit et que vous cherchez ensuite laquelle a bougé, vous trouverez toujours quelque chose : avec vingt indicateurs, un résultat significatif à 5 % apparaît par pur hasard. Les statisticiens appellent ça le problème des comparaisons multiples, et c'est la première cause de faux gains dans les rapports d'agence. Le choix de la métrique modifie aussi la conclusion. Un bouton d'ajout au panier plus voyant augmente presque toujours le taux d'ajout, et peut faire baisser le revenu par visiteur si les acheteurs ajoutent des articles qu'ils abandonnent ensuite. La métrique qui compte est celle qui se rapproche le plus de l'argent encaissé. **L'erreur qui invalide tout** Regarder les résultats tous les matins et arrêter le test dès que la barre du significatif est franchie. Cette pratique, le peeking, gonfle le taux de faux positifs bien au-delà des 5 % annoncés : en surveillant en continu, on finit par obtenir une significativité passagère dans presque tous les cas. On fixe la durée et la taille d'échantillon avant, et on attend. ## Comment le trafic est réparti, et pourquoi ce n'est pas un panel Un point mérite d'être rectifié, parce qu'il circule dans beaucoup d'articles de vulgarisation : on ne sélectionne pas les participants. On n'envoie pas d'e-mail aux clients jugés pertinents, on ne recrute pas un échantillon, on n'explique la démarche à personne. Le visiteur qui arrive sur la page est affecté au hasard à l'une des deux versions, un cookie ou un identifiant garde la trace de son affectation pour qu'il revoie toujours la même, et il ne sait pas qu'il participe à un test. Cette assignation aléatoire est ce qui donne sa valeur au résultat. Elle garantit que les deux groupes se ressemblent sur tout ce que vous ne mesurez pas : appareil, source de trafic, heure de visite, intention d'achat. Recruter volontairement des clients fidèles casserait exactement cette propriété et produirait un chiffre ininterprétable. ## Les trois familles de tests Le test A/B classique sert deux variantes sur la même URL, la modification étant appliquée côté navigateur ou côté serveur. C'est le format le plus courant et le plus rapide à déployer. Le split test par redirection envoie le trafic vers des URL distinctes. Utile quand la version B est une refonte complète hébergée ailleurs, il exige de soigner la configuration technique pour éviter que les moteurs de recherche n'interprètent mal ces pages jumelles. Une balise canonique et une redirection temporaire, jamais permanente. Le test multivarié, ou MVT, fait varier plusieurs éléments en même temps pour mesurer leur effet et leurs interactions. Séduisant sur le papier, il est hors de portée de la plupart des sites : quatre variations d'un titre croisées avec trois images font douze combinaisons, donc douze échantillons à remplir. Multipliez la taille d'échantillon du tableau plus haut par douze et vous verrez le problème. **Ce qui produit vraiment des gains** Les tests qui gagnent portent rarement sur la couleur d'un bouton. Ils touchent la proposition de valeur affichée en haut de page, la présence des frais de port dès la fiche produit, le nombre de champs d'un formulaire, ou la suppression d'une étape de tunnel. Testez des idées, pas des détails cosmétiques. ## Ce qu'un test ne dit pas Un résultat significatif indique qu'une différence existe, pas qu'elle est grande ni qu'elle durera. Sur un petit échantillon, les gains annoncés sont systématiquement surestimés : seuls les écarts les plus extrêmes franchissent le seuil, et ils reflètent en partie le bruit. Un test qui conclut à +35 % avec 800 visiteurs par variante donnera, une fois déployé, un gain réel bien plus modeste, quand il ne s'évapore pas. Un test ne dit rien non plus des segments. Une variante peut gagner globalement tout en dégradant l'expérience mobile, qui représente souvent 60 à 70 % du trafic d'un site marchand. Regardez la ventilation par appareil avant de déployer, sans en faire une pêche aux sous-groupes favorables : c'est une vérification de cohérence, pas une seconde chance de trouver un gagnant. ## La durée : deux semaines minimum, cycles complets Même avec un trafic suffisant, un test ne se lit pas au bout de trois jours. Le comportement d'achat varie fortement selon le jour de la semaine : un test lancé un lundi et arrêté un jeudi ignore le week-end, où le panier moyen et le taux de conversion diffèrent souvent de 20 à 30 %. La règle admise est de couvrir au moins deux semaines pleines, en cycles hebdomadaires entiers. Méfiez-vous aussi de l'effet de nouveauté. Un changement visuel marqué attire l'attention des visiteurs habitués et gonfle les chiffres les premiers jours, avant de retomber. Si votre courbe de gain décroît régulièrement à partir du troisième jour, vous avez probablement mesuré cet effet et non une amélioration durable. **Un calendrier réaliste** Une semaine pour formuler l'hypothèse et préparer la variante. Deux à quatre semaines de collecte selon le trafic. Une semaine d'analyse et de déploiement. Un test sérieux occupe donc un mois à un mois et demi, et une PME en mène raisonnablement huit à douze par an, pas cinquante. ## Avant de tester, savoir quoi tester L'A/B testing valide une hypothèse, il n'en produit aucune. Encore faut-il en avoir une, et elle vient d'ailleurs. Les données d'analytics repèrent les pages où le tunnel fuit et hiérarchisent les priorités. Les enregistrements de sessions et les cartes de chaleur montrent où les visiteurs s'arrêtent, cliquent sur ce qui n'est pas cliquable, ou ne descendent jamais. Cinq tests utilisateurs filmés, avec des personnes qui commentent à voix haute, révèlent en une matinée des blocages qu'aucun chiffre n'expose. Un audit ergonomique mené par un professionnel coûte quelques milliers d'euros et sort une liste de problèmes classés par gravité. Ces méthodes disent pourquoi ça coince. Le test dit si votre correctif fonctionne. Les enchaîner dans le bon ordre évite de tester au hasard pendant six mois. Sur la mécanique et le vocabulaire, les éditeurs du secteur publient des ressources détaillées, notamment sur l'[a/b testing](https://www.kameleoon.com/fr/ab-testing) et ses conditions de validité. **Si votre trafic est trop faible** Sous 5 000 visiteurs mensuels sur une page, oubliez l'A/B testing sur le taux de conversion. Testez plutôt une métrique intermédiaire plus fréquente, comme le clic sur un bouton, qui atteint la significativité bien plus vite. Ou appliquez directement les bonnes pratiques connues, sans les mesurer : elles valent mieux qu'un test non concluant. Un dernier mot sur les outils. Le marché va de solutions gratuites aux plateformes à plusieurs milliers d'euros par mois, et l'écart de prix porte surtout sur le ciblage, la personnalisation et l'accompagnement, pas sur la qualité du calcul statistique. Pour un premier test, un calculateur de taille d'échantillon en ligne et un outil d'entrée de gamme suffisent. Ce qui manque le plus souvent, ce n'est pas la technologie, c'est la discipline de fixer l'hypothèse et la durée avant de lancer. --- ## À propos de l'auteur **Delphine Macouin** — Je suis particulièrement intéressée par les rubriques Amour, Lifestyle et Santé. Ce qui ne m'empêche pas de donner mon avis sur d'autres sujets !