Lakehouse best practices
Wat in productie-Lakehouses het verschil maakt: Delta-onderhoud, V-Order, schema-discipline en de grens tussen Silver en Gold.
5 juni 2026
Delta-onderhoud is geen optie maar een taak
Plan OPTIMIZE en VACUUM als vaste onderhoudsjobs. Duizenden kleine files zijn de meest voorkomende oorzaak van trage queries, en ze ontstaan vanzelf bij frequente kleine writes. Wie streaming of micro-batches schrijft zonder compaction, bouwt gegarandeerd een traag Lakehouse.
Houd V-Order aan voor alles wat Power BI raakt
Direct Lake presteert bij gratie van V-Order-geoptimaliseerde Delta-bestanden. Zet het aan op Gold en op alles wat Power BI leest, en zet het niet uit "tijdelijk voor snellere writes", die tijdelijkheid wordt permanent en de rapportages worden traag. V-Order is wel een lees-versus-schrijf-afweging, geen gratis knop: op zware, schrijf-intensieve tussentabellen die geen rapportage voeden mag het bewust uit.
Verwerk incrementeel, ontwikkel in notebooks, produceer in jobs
De grootste stille capacity-slurper is elke nacht een full reload van Silver. Gebruik MERGE met de Change Data Feed zodat je alleen de delta verwerkt. En behandel transformatie als geteste, herbruikbare code: ontwikkel in notebooks, maar productionaliseer in Spark Job Definitions of pipelines, een notebook met verborgen celstaat is geen productie-artefact. Stop gedeelde logica in een geteste library in plaats van gekopieerde notebooks; tien kopieën zijn tien plekken om te patchen.
Grijp niet naar een grotere pool om een trage job te maskeren
Spark rekent per vCore-seconde, dus kortere runs zijn direct goedkoper. Los eerst small files, partitionering en joins op voordat je opschaalt. Zet een korte session-timeout (een sessie die blijft draaien terwijl niemand werkt is de grootste stille kostenpost), gebruik high concurrency om sessies te delen, en overweeg de Native Execution Engine: een van de weinige knoppen die tegelijk sneller én goedkoper is. Verifieer wel op je echte workload dat de zware operatoren daadwerkelijk native draaien, de terugval naar standaard-Spark is stil.
Schema-discipline in Silver
Sta geen ongecontroleerde schema-evolutie toe in Silver en Gold. Bronnen mogen veranderen; jouw Silver-schema verandert via een bewuste wijziging met versionering, niet via mergeSchema-verrassingen op vrijdagmiddag.
Model Gold per consumptiedoel
Eén brede "Gold voor alles" wordt onbeheersbaar. Maak Gold-modellen per gebruiksdoel (rapportage, ML-features, API) en accepteer beperkte duplicatie, goedkope opslag ruil je tegen dure verwarring als je het andersom doet.
Shortcuts vóór kopieën
Elke pipeline die alleen data verplaatst is technische schuld. Check eerst of een OneLake shortcut volstaat; kopieer alleen wanneer je transformatie, isolatie of retentie nodig hebt die de bron niet biedt.
Meet wat gebruikers merken
Monitor query-duur op Gold en versheid per tabel, dat zijn de twee metrieken waar gebruikers over bellen. Capaciteitsverbruik is jouw probleem; deze twee zijn hun probleem, en dus je eerste dashboards.