TechExplainedNL
|
Alle best practices
Best PracticeMicrosoft FabricOneLake

Lakehouse best practices

Wat in productie-Lakehouses het verschil maakt: Delta-onderhoud, V-Order, schema-discipline en de grens tussen Silver en Gold.

5 juni 2026

Delta-onderhoud is geen optie maar een taak

Plan OPTIMIZE en VACUUM als vaste onderhoudsjobs. Duizenden kleine files zijn de meest voorkomende oorzaak van trage queries, en ze ontstaan vanzelf bij frequente kleine writes. Wie streaming of micro-batches schrijft zonder compaction, bouwt gegarandeerd een traag Lakehouse.

Houd V-Order aan voor alles wat Power BI raakt

Direct Lake presteert bij gratie van V-Order-geoptimaliseerde Delta-bestanden. Zet het aan op Gold en op alles wat Power BI leest, en zet het niet uit "tijdelijk voor snellere writes", die tijdelijkheid wordt permanent en de rapportages worden traag. V-Order is wel een lees-versus-schrijf-afweging, geen gratis knop: op zware, schrijf-intensieve tussentabellen die geen rapportage voeden mag het bewust uit.

Verwerk incrementeel, ontwikkel in notebooks, produceer in jobs

De grootste stille capacity-slurper is elke nacht een full reload van Silver. Gebruik MERGE met de Change Data Feed zodat je alleen de delta verwerkt. En behandel transformatie als geteste, herbruikbare code: ontwikkel in notebooks, maar productionaliseer in Spark Job Definitions of pipelines, een notebook met verborgen celstaat is geen productie-artefact. Stop gedeelde logica in een geteste library in plaats van gekopieerde notebooks; tien kopieën zijn tien plekken om te patchen.

Grijp niet naar een grotere pool om een trage job te maskeren

Spark rekent per vCore-seconde, dus kortere runs zijn direct goedkoper. Los eerst small files, partitionering en joins op voordat je opschaalt. Zet een korte session-timeout (een sessie die blijft draaien terwijl niemand werkt is de grootste stille kostenpost), gebruik high concurrency om sessies te delen, en overweeg de Native Execution Engine: een van de weinige knoppen die tegelijk sneller én goedkoper is. Verifieer wel op je echte workload dat de zware operatoren daadwerkelijk native draaien, de terugval naar standaard-Spark is stil.

Schema-discipline in Silver

Sta geen ongecontroleerde schema-evolutie toe in Silver en Gold. Bronnen mogen veranderen; jouw Silver-schema verandert via een bewuste wijziging met versionering, niet via mergeSchema-verrassingen op vrijdagmiddag.

Model Gold per consumptiedoel

Eén brede "Gold voor alles" wordt onbeheersbaar. Maak Gold-modellen per gebruiksdoel (rapportage, ML-features, API) en accepteer beperkte duplicatie, goedkope opslag ruil je tegen dure verwarring als je het andersom doet.

Shortcuts vóór kopieën

Elke pipeline die alleen data verplaatst is technische schuld. Check eerst of een OneLake shortcut volstaat; kopieer alleen wanneer je transformatie, isolatie of retentie nodig hebt die de bron niet biedt.

Meet wat gebruikers merken

Monitor query-duur op Gold en versheid per tabel, dat zijn de twee metrieken waar gebruikers over bellen. Capaciteitsverbruik is jouw probleem; deze twee zijn hun probleem, en dus je eerste dashboards.

Lakehouse best practices | TechExplainedNL