News

QESTIT deltar i forskningsprojekt – AI och testning i fokus vid ICST

Skriven av QESTIT Team | 2026-jul-16 08:19:14

Två nya forskningsartiklar presenterades vid den internationella konferensen om mjukvarutestning (ICST), en av världens främsta mötesplatser för forskare, ingenjörer och praktiker som arbetar med mjukvarutestning, verifiering och validering. Studierna genomfördes som en del av T.A.R.G.E.T.-projektet, i samarbete med Blekinge Tekniska Högskola och vår partner Synteda.

Dessa resultat utgör nu grunden för nästa fas hos QESTIT, där våra konsulter kommer att börja utvärdera de föreslagna lösningarna i verkliga miljöer.

ICST 2025 hölls i Neapel, Italien, och fungerar som en global plattform för banbrytande forskning och tillämpad innovation inom testområdet.

STUDIE 1

Utvärdering av valet av LLM i en multiagentlösning för generering av GUI-tester

I korthet
Denna studie undersöker om ett multiagent-system som använder olika stora språkmodeller (LLM) kan prestera bättre än ett system där alla agenter använder samma modell. Hypotesen var att olika LLM har olika styrkor och svagheter när det gäller testgenerering, och att en kombination av dem skulle kunna leda till bättre resultat.

PathFinder: En prototyp för ett multiagent-system
För att utvärdera denna idé utvecklade teamet ett prototypsystem kallat PathFinder med fyra autonoma agenter. Dessa agenter är programmerade att:

  • Genomföra utforskande testning (upptäcka nya testfall)

  • Generera regressionstester (verifiera att befintlig funktionalitet förblir intakt)


Tre olika LLM:er – Mistral, Gemm2 och LLama3 – testades på fyra e-handelswebbplatser för att undersöka om en kombination av modeller skulle förbättra testkvaliteten.

Resultat: En modell per webbplats fungerar bäst...
Resultaten visade att hypotesen inte stämde vid testning av en enskild webbplats: att låta alla agenter använda samma LLM gav faktiskt bättre resultat än att blanda dem. En trolig orsak är att modellerna ”talar olika språk” och lägger tonvikten på olika aspekter av gränssnittet.

LLama fokuserade till exempel mer på webbkomponenter, medan Gemm2 prioriterade användaråtgärder såsom klick. Dessa skillnader försvårade kommunikationen och samordningen mellan agenterna när man använde en blandning av modeller.

…Men blandade modeller kan vara bättre på olika webbplatser
När målet är att skapa en mer generaliserbar lösning för användning på olika webbplatser eller i olika system kan det dock vara fördelaktigt att kombinera modeller. Olika LLM:er kan komplettera varandra mer effektivt i varierande miljöer eller användarscenarier.

STUDIE 2

LLM-baserad rapportering av inspelade automatiserade GUI-baserade testfall

I korthet
Denna studie undersöker hur generativ AI (LLM) kan användas för att analysera modellbaserade GUI-tester och automatiskt samla in kontextuella data för att förbättra testrapporternas användbarhet och tydlighet.

Så här fungerar det:

En demonstrator i Scout
Forskargruppen byggde in en lösning i Scout, ett akademiskt testverktyg som gör det möjligt för användare att ”spela in” tester genom att interagera med en webbapplikation, vilket gör testprocessen mer intuitiv.

Användning av generativ AI

Systemet analyserar den testade webbapplikationen och samlar in relevant kontextuell information (t.ex. funktionsbeskrivningar, flöden och potentiella användarscenarier). Dessa data läggs till i testrapporterna och hjälper även Scout att uppdatera sin interna testmodell, vilket förbättrar dess förståelse för applikationens beteende.


Resultat

Ett kvasiexperiment genomfördes för att utvärdera användarnas uppfattning av de utökade rapporterna. Deltagarna ansåg att de LLM-förbättrade rapporterna var mer meningsfulla och lättare att förstå.

Möjliga tillämpningar
Även om denna lösning utvecklades för Scout kan principerna generaliseras till andra verktyg och modellbaserade testmiljöer. Automatiserad kontextberikning skulle kunna bidra till bättre analys och rapportering över hela linjen.

Mer information:
Forskningsprojektet T.A.R.G.E.T. – Blekinge Tekniska Högskola