IA appliquée au test

L'IA écrit des tests. Elle ne décide toujours pas lesquels écrire.

Nous la faisons tourner en delivery depuis deux ans, pas en démonstration. Ce qui a changé n’est pas la nature du métier : c’est le volume qu’un consultant couvre dans une journée.

Prendre rendez-vous

Où elle rapporte

Quatre usages, par ordre de rentabilité constatée.

1 — Le premier jet

Générer des cas à partir d'une spécification ou d'une story. Le gain n'est pas la qualité du texte, c'est de ne plus partir de la page blanche.

  • Cas nominaux et cas aux limites proposés
  • Relecture humaine obligatoire, toujours

2 — La maintenance des ancrages

Réparer un sélecteur qui a bougé après une refonte d'écran. C'est la tâche la plus ingrate de l'automatisation, et la plus mécanique.

  • Moins de tests rouges pour rien
  • Le vrai poste de coût d'une base automatisée

3 — Le tri des échecs

Distinguer le défaut applicatif de l'environnement instable, et regrouper cinquante échecs qui ont la même cause.

  • Une campagne rouge redevient lisible
  • L'analyse passe de deux heures à dix minutes

4 — La comparaison en masse

Confronter des milliers de valeurs à un document de référence — un brief, un catalogue, un contrat d'interface.

  • 25 704 comparaisons en une minute sur un parc réel
  • Là où l'humain échantillonne, la machine couvre tout

Ce qu'elle ne fait pas

Elle ne décide rien. Et c'est structurel, pas provisoire.

Trois jugements restent hors de sa portée, et ce sont ceux qui engagent.

Ce qui mérite d’être testé. Arbitrer entre couvrir un parcours de paiement et couvrir un écran d’administration suppose de savoir ce que l’entreprise perd dans chaque cas. Aucun modèle ne connaît ce chiffre.

Ce que coûte une anomalie. Un défaut d’affichage sur un écran interne et le même défaut sur une borne client n’ont pas la même valeur. La hiérarchisation est une décision métier.

Si une version part en production. C’est un engagement, avec un responsable identifié. Il ne se délègue pas à une probabilité.

Ajoutons une limite plus prosaïque : un modèle produit du plausible. Sur un test, le plausible qui est faux est pire que rien — il crée une confiance qu’aucun humain ne va rouvrir. D’où notre règle : tout ce que l’IA produit est relu, et tout ce qui échoue est vérifié à la main avant d’être déclaré défaut.

En pratique

Deux ans de production, pas une expérimentation.

2 ans
d'usage en delivery, pas en laboratoire
5 s
pour rejouer un parcours, contre 30 à 50 minutes
756
articles d'une carte relus et comparés en une minute

Ce que ça produit concrètement : une couverture qui passe de l’échantillon à la totalité. Ce que nous vérifiions sur quelques restaurants, nous le vérifions sur tout un parc — non parce que l’outil est plus intelligent, mais parce qu’il ne se fatigue pas et ne saute pas la ligne 431.

Questions franches

Ce qu'on nous demande

L'IA va-t-elle remplacer les testeurs ?

Non — et nous sommes bien placés pour le dire, puisque nous la faisons tourner en delivery depuis deux ans. Elle rédige un premier jet, maintient les sélecteurs, trie les échecs et compare en masse. Ce qui mérite d'être testé, ce que coûte une anomalie et si une version part en production restent des jugements. Ce qui a changé, c'est le volume couvert.

Nos données partent-elles dans un modèle public ?

Pas sans votre accord explicite, et jamais par défaut. Selon votre politique, nous travaillons sur des jeux anonymisés, sur un modèle hébergé chez vous, ou sans IA du tout sur les périmètres sensibles. C'est une question à trancher au cadrage, pas en cours de route.

Comment savoir si un test généré est bon ?

Par la même relecture que pour un test écrit à la main : est-il rejouable, sa réponse est-elle binaire, teste-t-il quelque chose qui a de la valeur ? Un cas généré qui échoue à ces trois questions est supprimé, pas conservé parce qu'il est gratuit.

Par où commencer sans tout bouleverser ?

Par la maintenance des ancrages et le tri des échecs : deux usages invisibles pour le métier, sans risque sur la qualité, et qui rendent du temps dès la première semaine. La génération de cas vient après, quand la relecture est en place.

Parlons de ce que vous n’arrivez pas encore à tester.

Un audit de votre démarche de test, sans engagement, pour savoir où vous en êtes vraiment.

Prendre rendez-vous
fr_FRFrench