1 — Le premier jet
Générer des cas à partir d'une spécification ou d'une story. Le gain n'est pas la qualité du texte, c'est de ne plus partir de la page blanche.
- Cas nominaux et cas aux limites proposés
- Relecture humaine obligatoire, toujours
IA appliquée au test
Nous la faisons tourner en delivery depuis deux ans, pas en démonstration. Ce qui a changé n’est pas la nature du métier : c’est le volume qu’un consultant couvre dans une journée.
Prendre rendez-vousOù elle rapporte
Générer des cas à partir d'une spécification ou d'une story. Le gain n'est pas la qualité du texte, c'est de ne plus partir de la page blanche.
Réparer un sélecteur qui a bougé après une refonte d'écran. C'est la tâche la plus ingrate de l'automatisation, et la plus mécanique.
Distinguer le défaut applicatif de l'environnement instable, et regrouper cinquante échecs qui ont la même cause.
Confronter des milliers de valeurs à un document de référence — un brief, un catalogue, un contrat d'interface.
Ce qu'elle ne fait pas
Trois jugements restent hors de sa portée, et ce sont ceux qui engagent.
Ce qui mérite d’être testé. Arbitrer entre couvrir un parcours de paiement et couvrir un écran d’administration suppose de savoir ce que l’entreprise perd dans chaque cas. Aucun modèle ne connaît ce chiffre.
Ce que coûte une anomalie. Un défaut d’affichage sur un écran interne et le même défaut sur une borne client n’ont pas la même valeur. La hiérarchisation est une décision métier.
Si une version part en production. C’est un engagement, avec un responsable identifié. Il ne se délègue pas à une probabilité.
Ajoutons une limite plus prosaïque : un modèle produit du plausible. Sur un test, le plausible qui est faux est pire que rien — il crée une confiance qu’aucun humain ne va rouvrir. D’où notre règle : tout ce que l’IA produit est relu, et tout ce qui échoue est vérifié à la main avant d’être déclaré défaut.
En pratique
Ce que ça produit concrètement : une couverture qui passe de l’échantillon à la totalité. Ce que nous vérifiions sur quelques restaurants, nous le vérifions sur tout un parc — non parce que l’outil est plus intelligent, mais parce qu’il ne se fatigue pas et ne saute pas la ligne 431.
Questions franches
Non — et nous sommes bien placés pour le dire, puisque nous la faisons tourner en delivery depuis deux ans. Elle rédige un premier jet, maintient les sélecteurs, trie les échecs et compare en masse. Ce qui mérite d'être testé, ce que coûte une anomalie et si une version part en production restent des jugements. Ce qui a changé, c'est le volume couvert.
Pas sans votre accord explicite, et jamais par défaut. Selon votre politique, nous travaillons sur des jeux anonymisés, sur un modèle hébergé chez vous, ou sans IA du tout sur les périmètres sensibles. C'est une question à trancher au cadrage, pas en cours de route.
Par la même relecture que pour un test écrit à la main : est-il rejouable, sa réponse est-elle binaire, teste-t-il quelque chose qui a de la valeur ? Un cas généré qui échoue à ces trois questions est supprimé, pas conservé parce qu'il est gratuit.
Par la maintenance des ancrages et le tri des échecs : deux usages invisibles pour le métier, sans risque sur la qualité, et qui rendent du temps dès la première semaine. La génération de cas vient après, quand la relecture est en place.
Un audit de votre démarche de test, sans engagement, pour savoir où vous en êtes vraiment.
Prendre rendez-vous