Det korte svar

Test AI på repræsentative opgaver med et kendt vurderingsgrundlag. Mål både, om svaret er korrekt, og om løsningen afstår fra at svare, når grundlaget mangler. Ét samlet gennemsnit kan skjule alvorlige fejl i en vigtig sagstype.

Definér et godt svar før testen

Beskriv, hvad en medarbejder skal kunne stole på: rette kunde, korrekt vare, præcis status og ingen løfter uden kilde. Skeln mellem faktafejl, udeladelser og sproglige forbedringer. Hvis alle fejl tæller ens, kan en alvorlig fejl drukne blandt små rettelser.

For en intern vidensassistent bør et godt svar også pege på den relevante kilde. Et svar, som tilfældigvis er rigtigt uden det nødvendige grundlag, er ikke det samme som en pålidelig søgeløsning.

Fordel testsager på flere sværhedsgrader

Saml virkelige problemtyper, men anonymisér eller brug godkendte testdata. Hold et sæt tilbage fra den løbende tilpasning. Ellers risikerer I blot at lære løsningen at klare de eksempler, som udvikleren hele tiden ser.

Fordel testsager på flere sværhedsgrader
SagstypeDet undersøger I
Entydigt spørgsmålKan løsningen finde og gengive fakta?
Manglende oplysningKan den sige, hvad der mangler?
Modstridende kilderKan den vise konflikten og stoppe?
Forkert adgangUndlader den at vise utilgængelige oplysninger?
Usædvanlig formuleringForstår den spørgsmålet uden at ændre betydningen?

Læs resultatet pr. fejltype

Antag illustrativt, at 45 af 50 svar er brugbare. En samlet andel på 90 procent fortæller ikke, om de fem fejl er harmløse formuleringer eller fem svar om den forkerte kunde. Registrér derfor alvor og hvilken kontrol, der burde have fanget fejlen.

Lad to personer vurdere et udsnit uafhængigt. Uenighed kan vise, at kriterierne er uklare. For faktaspørgsmål bør vurderingen bygge på kilden; for formulering kan en kort rubrik beskrive ønsket tone, længde og forståelighed. Vælg acceptgrænser ud fra konsekvensen i jeres proces.

Gør evaluering til en del af ændringer

Kør de relevante tests igen, når datakilder, prompt, model eller adgangsregler ændres. Gem ændringen sammen med testresultatet, så en forringelse kan spores. Brug også nye fejl fra drift som fremtidige testsager.

En godkendt test er ikke en garanti for alle fremtidige input. Bevar derfor overvågning, en stopmulighed og en kø til tvivlssager. Løsningen kan eventuelt starte som svarforslag, mens I samler erfaring med den virkelige fordeling af spørgsmål.

Brug det i praksis

Jeres næste skridt

  1. Skriv acceptkriterier for fakta, kilder og stopadfærd.
  2. Medtag både almindelige spørgsmål og kendte fejltyper.
  3. Hold et separat testsæt uden for prompttilpasningen.
  4. Vurdér alvorlige fejl særskilt fra sprogfejl.
  5. Gentag testen efter relevante ændringer og gem resultatet.

Ofte stillede spørgsmål

Hvor mange testsager er nok?+

Det afhænger af variation og konsekvens. Begynd med et overskueligt sæt, der dækker alle kritiske sagstyper, og udvid med erfaring fra drift.

Kan AI selv bedømme svarene?+

AI kan hjælpe med sortering og forslag til vurdering, men kritiske fakta og fejltyper bør kontrolleres mod kilder og faglige kriterier.

Hvilket mål er vigtigst?+

Det mål, der afspejler konsekvensen for brugeren. I en ordresag kan korrekt kundeidentitet være vigtigere end en høj gennemsnitlig sproglig kvalitet.

Kilder og faglig baggrund

De praktiske eksempler og tjeklister er udarbejdet til denne guide. Følgende kilder uddyber de angivne faglige begreber.

Microsoft: design og evaluering af RAG (åbner i ny fane)

Teknisk baggrund om at hente dokumentkontekst og vurdere svarkvalitet.

Begreber i guiden

AI-hallucinationFine-tuning

Fra guiden til jeres arbejdsgang

Brug et afgrænset pilotforløb til at teste metoden på jeres data og undtagelser.

Sådan kommer I i gang med AI-automatisering
Om guiden

Udgivet af Norstream med AI-assisteret udarbejdelse. Eksempler er illustrative, medmindre andet er angivet. Tilpas metoder og kontroller til jeres systemer og faglige ansvar.

Har du en rettelse eller et spørgsmål?