Hvad er embeddings?
Embeddings er numeriske repræsentationer af tekst (eller andet indhold), hvor meningsfuldt lignende indhold ligger tæt på hinanden i et matematisk rum. Når I søger med embeddings, finder I ikke bare det samme ord, men passager der handler om det samme emne, selv om formuleringen er anderledes. Det er motoren bag semantisk søgning og RAG.
Hvorfor embeddings betyder noget for virksomheder
Klassisk søgning kræver, at brugeren kender de præcise ord i dokumentet. Embeddings gør det muligt at spørge "hvordan godkender vi en reklamation?" og finde en procedure, der kun skriver "returnering og kreditnota". For interne vidensbaser, kontrakter og supportdokumentation er det ofte forskellen på et hit og ingen resultater.
Vi ser ofte embeddings præsenteret som en teknisk detalje. I praksis er det det lag, der afgør, om jeres AI-assistent finder det rigtige afsnit, eller om den improviserer ud fra generel viden.
Sådan bruges embeddings i et RAG-flow
- Dokumenter deles op i mindre stykker (chunks).
- Hvert stykke konverteres til en embedding og gemmes i en vektordatabase.
- Brugerens spørgsmål embeddes på samme måde.
- De nærmeste stykker hentes og sendes til sprogmodellen som kontekst.
Kvaliteten afhænger mindre af modellen end af chunking, metadata og adgangsstyring: hvem må se hvilke dokumenter, og er indekset opdateret, når procedurer ændres?
Byg ikke et indeks over hele virksomheden på dag ét
Start med ét domæne: HR-politik, produktmanualer, eller én sagstype. Test 30 spørgsmål, som medarbejdere faktisk stiller, og mål præcision og recall groft. Når hitraten holder, udvid kilden. Embeddings er infrastruktur; værdien er det flow, de betjener, fx automatiseret videnssøgning eller support.