move-left Back
Sweden
AI-Powered Testing

QESTIT participe à un projet de recherche – L’IA et les tests à l’honneur à l’ICST

Deux articles de recherche récents ont été présentés lors de la Conférence internationale sur les tests logiciels (ICST), l’un des principaux rendez-vous mondiaux pour les chercheurs, les ingénieurs et les professionnels travaillant dans les domaines des tests, de la vérification et de la validation logiciels. Ces études ont été menées dans le cadre du projet T.A.R.G.E.T., en collaboration avec l’Institut de technologie de Blekinge et notre partenaire Synteda.

Ces résultats constituent désormais la base de la prochaine phase chez QESTIT, au cours de laquelle nos consultants commenceront à évaluer les solutions proposées dans des conditions réelles.

L’ICST 2025 s’est tenu à Naples, en Italie, et constitue une plateforme mondiale dédiée à la recherche de pointe et à l’innovation appliquée dans le domaine des tests.

ÉTUDE 1

Évaluation du choix du modèle LLM dans une solution multi-agents pour la génération de tests d'interface graphique

En bref
Cette étude examine si un système multi-agents utilisant différents grands modèles linguistiques (LLM) peut surpasser un système dans lequel tous les agents utilisent le même modèle. L’hypothèse était que différents LLM présentent des forces et des faiblesses distinctes en matière de génération de tests, et que leur combinaison pourrait conduire à de meilleurs résultats.

PathFinder : un prototype multi-agents
Pour évaluer cette idée, l’équipe a développé un prototype de système appelé PathFinder, composé de quatre agents autonomes. Ces agents sont programmés pour :

  • Effectuer des tests exploratoires (découvrir de nouveaux cas de test)

  • générer des tests de régression (vérifier que les fonctionnalités existantes restent intactes)


Trois grands modèles de langage (LLM) différents – Mistral, Gemm2 et LLama3 – ont été testés sur quatre sites de commerce électronique afin de déterminer si l’utilisation d’une combinaison de modèles permettrait d’améliorer la qualité des tests.

Résultats : un modèle par site donne les meilleurs résultats…
Les résultats ont montré que l’hypothèse ne se vérifiait pas lors des tests sur un seul site web : le fait que tous les agents utilisent le même LLM produisait en réalité de meilleurs résultats que de les mélanger. Une raison probable est que les modèles « parlent des langues différentes » et mettent l’accent sur des aspects différents de l’interface.

Par exemple, LLama s’est davantage concentré sur les composants web, tandis que Gemm2 a donné la priorité aux actions des utilisateurs, telles que les clics. Ces différences ont rendu la communication et la coordination entre les agents plus difficiles lors de l’utilisation de modèles mixtes.

…Mais les modèles mixtes peuvent s’avérer plus efficaces sur différents sites web
Toutefois, lorsque l’objectif est de créer une solution plus généralisable, destinée à être utilisée sur divers sites ou systèmes, la combinaison de modèles peut s’avérer avantageuse. Différents LLM peuvent se compléter plus efficacement dans des environnements ou des scénarios d’utilisation variés.

ÉTUDE 2

Génération de rapports, à partir de LLM, de cas de test automatisés enregistrés via une interface graphique

En bref
Cette étude explore comment l’IA générative (LLM) peut être utilisée pour analyser des tests d’interface graphique basés sur des modèles et collecter automatiquement des données contextuelles afin d’améliorer la pertinence et la clarté des rapports de test.

Fonctionnement :

Un démonstrateur dans Scout
L’équipe de recherche a intégré une solution à Scout, un outil de test universitaire qui permet aux utilisateurs d’« enregistrer » des tests en interagissant avec une application web, rendant ainsi le processus de test plus intuitif.

Utilisation de l’IA générative

Le système analyse l’application web testée et recueille des informations contextuelles pertinentes (par exemple, des descriptions fonctionnelles, des flux et des scénarios d’utilisation potentiels). Ces données sont ajoutées aux rapports de test et aident également Scout à mettre à jour son modèle de test interne, améliorant ainsi sa compréhension du comportement de l’application.


Résultats

Une quasi-expérience a été menée pour évaluer la perception des utilisateurs face à ces rapports enrichis. Les participants ont jugé les rapports améliorés par le LLM plus pertinents et plus faciles à comprendre.

Applications potentielles
Bien que cette solution ait été développée pour Scout, ses principes peuvent être généralisés à d’autres outils et environnements de test basés sur des modèles. L’enrichissement automatisé du contexte pourrait permettre d’améliorer l’analyse et le reporting à tous les niveaux.

Plus d’informations :
Projet de recherche T.A.R.G.E.T. – Institut de technologie de Blekinge

Tags

AI-Powered Testing All Industries All Business Units