Hvad er LLM guardrails?
LLM guardrails er de tekniske og organisatoriske rammer, der begrænser, hvad en sprogmodel må sige og gøre i et enterprise-workflow: blokering af følsomme emner, validering af output, filtrering af input, og beskyttelse mod manipulation som prompt injection. Guardrails er sikkerheds- og kvalitetslaget omkring modellen, ikke selve modellen.
Prompt injection er et integrationsproblem
Vi ser ofte guardrails diskuteret som "bedre prompts". Prompt injection er, når en bruger eller et dokument får modellen til at ignorere instruktioner og udføre uønskede handlinger, især når modellen kan kalde værktøjer eller læse eksternt indhold. Derfor hører guardrails sammen med arkitektur: adskil brugerinput fra systeminstruktioner, valider output før handling, og tillad kun whitelistede funktioner.
Typiske lag:
- Input: sanitering, længdegrænser, blokering af kendte angrebsmønstre.
- Model: systemprompts og modelinstruktioner med klare grænser.
- Output: skema-validering, PII-detektion, menneskelig godkendelse.
- Handling: ingen fri API-adgang; kun foruddefinerede kald med logning.
Guardrails erstatter ikke menneskelig kontrol
Ved høj konsekvens skal guardrails eskalere til et menneske, ikke improvisere. Det er samme princip som hallucinationskontrol: lav risiko kan automatiseres, høj risiko kræver godkendelse og sporbarhed.
Hos Radiometer validerer sprogspecialister i et dedikeret workspace, før oversættelser går videre. Det er guardrails i praksis: proces og menneske som sidste led, ikke kun et filter på modellens tekst. Se casen her.
Test med ondsindede og dumme input
Før go-live: prøv at få botten til at lække instruktioner, kalde forkerte værktøjer og opfinde fakta. Ret arkitekturen, ikke kun prompten. Guardrails er færdige, når angrebene fejler og normale brugere stadig får værdi.