Hvad er AI-model evaluering og validering?
AI-model evaluering og validering er den systematiske test af, om en model eller et flow lever op til jeres kvalitetskrav på rigtige data, før det skaleres i drift. Det omfatter præcision, fejltyper, bias, omkostning og robusthed over for edge cases.
Demo-test er ikke evaluering
Vi ser ofte 5 glatte eksempler brugt som go-live-kriterium. Evaluering kræver et sæt af rigtige sager med kendt korrekt svar, måling af fejlprocent, og review af de værste fejl. Gentag når model, prompt eller data ændres.
Metrikker afhænger af opgaven: klassificering (accuracy), udtræk (feltkorrekthed), generering (menneskelig vurdering + kildecheck).
Evaluering er kontinuerlig drift
Efter launch: stikprøver, alarmer ved kvalitetsfald, gen-evaluering ved modelskift. Gem evalueringsdatasæt, så I kan sammenligne før og efter ændringer. Knyt til AI-drift og risikostyring. Radiometer validerer løbende i validator-workspace med faste testscenarier. Se casen.
Sådan kommer I i gang
- Saml 30-50 rigtige sager med kendt korrekt svar.
- Definér én primær metrik per opgavetype.
- Kør evaluering før hver model- eller promptændring.
- Gem resultater, så I kan sammenligne over tid.
Evaluering tager en dag at sætte op og sparer uger af diskussioner i møder. Uden tal taler man om følelsen af kvalitet, ikke kvaliteten.
Det vigtige at tage med
Uden evaluering ender hvert modelskift i en uendelig 'synes du det ser bedre ud?'-diskussion. Tal gør beslutningen kedelig på den gode måde. Se procesautomatisering for hvordan vi bygger første flow i praksis, eller workshops hvis teamet skal op på samme niveau før implementering.