RAG-referentiearchitectuur
Retrieval-Augmented Generation met Foundry en Azure AI Search: de onderdelen, de keuzes per onderdeel en waar het in de praktijk misgaat.
15 mei 2026
Het patroon
RAG haalt bij elke vraag eerst relevante passages op uit je eigen data en laat het taalmodel vervolgens antwoorden op basis van uitsluitend die passages. De keten: ingestie en chunking, embedding en indexering, retrieval (hybride: vector plus keyword), optioneel reranking, en tenslotte generatie met bronvermelding.
In het Microsoft-landschap: Azure AI Search als retrieval-laag, Foundry voor modelkeuze, orchestratie, evaluaties en content safety.
Wanneer gebruik je dit
- Kennis verandert vaker dan je een model wilt hertrainen (beleid, documentatie, productdata).
- Antwoorden moeten herleidbaar zijn naar bronnen, de kern van enterprise-inzet.
- Je data is tekstueel of goed tekstueel te representeren.
Wanneer juist niet
- Het antwoord vereist rekenen of aggregatie over data ("wat was de omzet in Q3"), dat is een query, geen retrieval. Overweeg text-to-SQL of een agent met tools.
- De kennis past in de prompt: bij een handvol documenten is een lange context eenvoudiger en vaak beter.
- Binnen Microsoft 365-data met standaardeisen: daar is Microsoft 365 Copilot met de Semantic Index vaak sneller naar waarde dan zelf bouwen.
Keuzes per onderdeel
- Chunking: volg documentstructuur (koppen, artikelen). Vaste blokgroottes knippen clausules doormidden, de klassieke oorzaak van halve antwoorden.
- Retrieval: start hybride met semantic ranking. Puur vector-zoeken faalt op exacte termen (artikelnummers, productcodes); puur keyword faalt op synoniemen.
- Generatie: dwing bronvermelding af en definieer weigeringsgedrag onder een retrieval-drempel. Liever "geen antwoord" dan een verzonnen antwoord.
Trade-offs
- Elke kwaliteitsstap (reranking, grotere context, groter model) verhoogt kosten en latency. Meet per stap of hij zijn geld waard is, met evaluaties, niet met gevoel.
- Index-verversing versus actualiteit: realtime indexeren is duur; dagelijkse verversing is voor de meeste kennisbanken genoeg. Leg de afspraak expliciet vast.
Praktijkvalkuilen
Negen van de tien "het model hallucineert"-klachten zijn retrieval-problemen: het juiste stuk tekst zat niet in de context. Log daarom altijd de opgehaalde chunks bij elk antwoord. En bouw je evaluatieset vóórdat je gaat tunen, anders optimaliseer je op anekdotes.