Det korte svar
Test AI på repræsentative opgaver med et kendt vurderingsgrundlag. Mål både, om svaret er korrekt, og om løsningen afstår fra at svare, når grundlaget mangler. Ét samlet gennemsnit kan skjule alvorlige fejl i en vigtig sagstype.
Definér et godt svar før testen
Beskriv, hvad en medarbejder skal kunne stole på: rette kunde, korrekt vare, præcis status og ingen løfter uden kilde. Skeln mellem faktafejl, udeladelser og sproglige forbedringer. Hvis alle fejl tæller ens, kan en alvorlig fejl drukne blandt små rettelser.
For en intern vidensassistent bør et godt svar også pege på den relevante kilde. Et svar, som tilfældigvis er rigtigt uden det nødvendige grundlag, er ikke det samme som en pålidelig søgeløsning.
Fordel testsager på flere sværhedsgrader
Saml virkelige problemtyper, men anonymisér eller brug godkendte testdata. Hold et sæt tilbage fra den løbende tilpasning. Ellers risikerer I blot at lære løsningen at klare de eksempler, som udvikleren hele tiden ser.
| Sagstype | Det undersøger I |
|---|---|
| Entydigt spørgsmål | Kan løsningen finde og gengive fakta? |
| Manglende oplysning | Kan den sige, hvad der mangler? |
| Modstridende kilder | Kan den vise konflikten og stoppe? |
| Forkert adgang | Undlader den at vise utilgængelige oplysninger? |
| Usædvanlig formulering | Forstår den spørgsmålet uden at ændre betydningen? |
Læs resultatet pr. fejltype
Antag illustrativt, at 45 af 50 svar er brugbare. En samlet andel på 90 procent fortæller ikke, om de fem fejl er harmløse formuleringer eller fem svar om den forkerte kunde. Registrér derfor alvor og hvilken kontrol, der burde have fanget fejlen.
Lad to personer vurdere et udsnit uafhængigt. Uenighed kan vise, at kriterierne er uklare. For faktaspørgsmål bør vurderingen bygge på kilden; for formulering kan en kort rubrik beskrive ønsket tone, længde og forståelighed. Vælg acceptgrænser ud fra konsekvensen i jeres proces.
Gør evaluering til en del af ændringer
Kør de relevante tests igen, når datakilder, prompt, model eller adgangsregler ændres. Gem ændringen sammen med testresultatet, så en forringelse kan spores. Brug også nye fejl fra drift som fremtidige testsager.
En godkendt test er ikke en garanti for alle fremtidige input. Bevar derfor overvågning, en stopmulighed og en kø til tvivlssager. Løsningen kan eventuelt starte som svarforslag, mens I samler erfaring med den virkelige fordeling af spørgsmål.
Brug det i praksis
Jeres næste skridt
- Skriv acceptkriterier for fakta, kilder og stopadfærd.
- Medtag både almindelige spørgsmål og kendte fejltyper.
- Hold et separat testsæt uden for prompttilpasningen.
- Vurdér alvorlige fejl særskilt fra sprogfejl.
- Gentag testen efter relevante ændringer og gem resultatet.
Ofte stillede spørgsmål
Hvor mange testsager er nok?+
Det afhænger af variation og konsekvens. Begynd med et overskueligt sæt, der dækker alle kritiske sagstyper, og udvid med erfaring fra drift.
Kan AI selv bedømme svarene?+
AI kan hjælpe med sortering og forslag til vurdering, men kritiske fakta og fejltyper bør kontrolleres mod kilder og faglige kriterier.
Hvilket mål er vigtigst?+
Det mål, der afspejler konsekvensen for brugeren. I en ordresag kan korrekt kundeidentitet være vigtigere end en høj gennemsnitlig sproglig kvalitet.
Kilder og faglig baggrund
De praktiske eksempler og tjeklister er udarbejdet til denne guide. Følgende kilder uddyber de angivne faglige begreber.
Teknisk baggrund om at hente dokumentkontekst og vurdere svarkvalitet.
Begreber i guiden
Fra guiden til jeres arbejdsgang
Brug et afgrænset pilotforløb til at teste metoden på jeres data og undtagelser.
Udgivet af Norstream med AI-assisteret udarbejdelse. Eksempler er illustrative, medmindre andet er angivet. Tilpas metoder og kontroller til jeres systemer og faglige ansvar.
Har du en rettelse eller et spørgsmål?