TechExplainedNL
|
Alle how-to's
How-toMicrosoft FoundryAzure AI

Hoe kies je een LLM

Een selectiekader voor modelkeuze in Microsoft Foundry: van eisen naar shortlist naar meetbare beslissing, zonder benchmark-bingo.

20 mei 2026

Stap 1: Begin bij de taak, niet bij het model

Formuleer wat het model concreet moet doen: samenvatten, classificeren, redeneren over meerdere stappen, code genereren, of een gesprek voeren met toolgebruik. Publieke benchmarks meten gemiddelden over alles; jij hebt maar één taak nodig die goed werkt.

Stap 2: Stel je harde eisen op

  • Dataresidency en compliance: welke regio's mogen? Dit schrapt vaak meer modellen dan enige benchmark.
  • Latency: een klantgesprek vereist andere responstijden dan een nachtelijke batch.
  • Contextlengte: hoeveel moet er echt in de prompt? Meer context is trager en duurder, en vaak een teken dat retrieval beter moet.
  • Kosten per duizend interacties bij verwacht volume, niet per token in een demo.

Stap 3: Maak een shortlist van drie

Kies uit de Foundry-modelcatalogus: één klein en goedkoop model, één middenklasse, één topmodel. De vraag is niet "welk model is het beste" maar "wat is het kleinste model dat de taak aantoonbaar goed genoeg doet".

Stap 4: Evalueer op je eigen data

Bouw een evaluatieset van echte voorbeelden uit jouw context en draai alle drie de modellen erdoor met Foundry evaluations. Meet taakspecifiek: juistheid, groundedness, formaat-naleving, weigeringsgedrag. Tien echte voorbeelden zeggen meer dan elke leaderboard.

Stap 5: Reken het businessmodel door

Extrapoleer naar productievolume. Een model dat twee keer zo goed scoort maar tien keer zo duur is, is zelden de juiste keuze voor hoogvolume-taken, een klein model kan grofweg tien tot dertig keer goedkoper per token zijn dan een frontier-model. Denk daarom in een portfolio in plaats van één model: klein en snel waar het kan, groot of redenerend waar het moet. Eén groot model voor alles inzetten is een Formule 1-wagen gebruiken om de post rond te brengen: technisch indrukwekkend, economisch onverdedigbaar.

Bij gemengd verkeer automatiseer je die keuze met de Model Router: je deployt hem als één endpoint, de applicatie praat alleen met dat endpoint, en de router stuurt elke vraag in real time naar het meest geschikte onderliggende model. Wel een harde best practice: meet de routingverdeling. Als negentig procent van je verkeer alsnog naar het dure model gaat, klopt er iets niet in je promptontwerp of je verwachting. Kies alleen een vast model als exacte reproduceerbaarheid of een strikte modelgoedkeuring dat afdwingt, bijvoorbeeld in een gereguleerd besluit.

Stap 6: Kies deployment en capaciteit bewust

Provisioned Throughput voor hoog, voorspelbaar volume met een strakke latency-eis; pay-as-you-go voor variabel of experimenteel verkeer. Kies het deployment-type op data residency (Data Zone als data binnen bijvoorbeeld de EU moet blijven), plan quota per regio en per model, en weet dat niet elk model in elke regio beschikbaar is.

Stap 7: Ontwerp voor vervanging

Modellen krijgen nieuwe versies en worden met pensioen gestuurd. Leg vast welke versie je gebruikt en test een nieuwe versie tegen je evaluatieset voordat je overstapt, anders krijg je een stille kwaliteitsregressie. Abstraheer de modelkeuze in je architectuur (Foundry maakt wisselen eenvoudig), houd je evaluatieset actueel en herhaal de vergelijking elk kwartaal. Modelkeuze is geen eenmalige beslissing maar een terugkerend proces.

Hoe kies je een LLM | TechExplainedNL