Wat lokale AI precies is
Lokale AI is het draaien van een taalmodel op infrastructuur die jij beheert. Dat kan een server in je eigen serverruimte zijn, maar in de praktijk is het vaker een afgesloten omgeving bij een hostingpartij binnen de EU. Het onderscheid dat telt is niet de fysieke locatie maar de vraag wie bij de data kan en onder welk recht dat valt.
Drie varianten kom je tegen:
- Volledig lokaal: het model draait op je eigen hardware, er gaat geen enkele byte naar buiten
- Eigen omgeving bij een Europese aanbieder: je huurt rekenkracht, maar het model en de data staan in jouw omgeving en worden niet gedeeld
- Cloud-API met verwerkersafspraken: je gebruikt een model van een grote aanbieder met contractuele waarborgen over bewaren en trainen
Alle drie zijn verdedigbare keuzes. Het verschil zit in hoeveel je zelf moet regelen en hoeveel je op papier kunt aantonen. Wij bouwden met IntraGPT een lokale AI-omgeving waarin medewerkers met bedrijfsdocumenten kunnen werken zonder dat die documenten de organisatie verlaten.
Wat Europa in 2026 heeft besloten
Op 3 juni 2026 presenteerde de Europese Commissie het pakket voor technologische soevereiniteit. Dat bestaat uit vier onderdelen:
- Chips Act 2.0 voor halfgeleidercapaciteit
- De Cloud and AI Development Act, die datacenterbouw in Europa moet versnellen en een gezamenlijk beoordelingskader voor cloud- en AI-soevereiniteit vastlegt
- Een open source-strategie die overheden aanmoedigt open alternatieven te gebruiken
- Een routekaart voor digitalisering en AI in de energiesector
Het meest concrete doel: de datacentercapaciteit in de EU moet binnen vijf tot zeven jaar verdrievoudigen, met kortere vergunningsprocedures. De achterliggende gedachte is steeds dezelfde, in de woorden van Commissievoorzitter Von der Leyen: Europa kan zich niet permitteren afhankelijk te zijn van anderen voor de technologie die ziekenhuizen en energienetten draaiende houdt.
Voor bedrijven is dit geen verplichting, maar wel een richting. Wie levert aan overheden of aan organisaties die onder de Cyberbeveiligingswet vallen, krijgt dit soort vragen steeds vaker via de keten binnen.
De vier soevereiniteitsniveaus uit het EU-raamwerk
Het Cloud Sovereignty Framework maakt soevereiniteit voor het eerst meetbaar. Leveranciers worden beoordeeld op acht dimensies, waaronder juridische controle, operationele onafhankelijkheid, transparantie in de toeleveringsketen, technologische openheid, beveiliging en duurzaamheid. Daarbovenop staan vier oplopende zekerheidsniveaus:
- Niveau 1: verwerking vindt plaats op EU-infrastructuur
- Niveau 2: aantoonbare onafhankelijkheid van derde landen, met transparantie daarover
- Niveau 3: eigendom en zeggenschap liggen in de EU
- Niveau 4: volledige ketentransparantie zonder inmenging vanuit derde landen
Dat het geen papieren exercitie is, bleek in april 2026: de Commissie gunde op basis van dit raamwerk voor 180 miljoen euro aan soevereine clouddiensten over zes jaar aan vier Europese partijen, waaronder Scaleway, StackIT, Proximus en een consortium rond Post Telecom met OVHcloud en CleverCloud.
Praktisch nut voor jou: gebruik deze niveaus als vragenlijst bij je eigen leveranciers. Ze dwingen een concreet antwoord af op de vraag waar je data staat en wie er juridisch bij kan.
Welke open modellen bruikbaar zijn en onder welke licentie
De licentie bepaalt of je een model commercieel mag draaien en of je het mag bijtrainen. Dat is bij open modellen niet overal hetzelfde:
- gpt-oss-120b en gpt-oss-20b van OpenAI verschenen in augustus 2025 onder Apache 2.0, een van de ruimste licenties
- Qwen van Alibaba brengt sinds Qwen3 alle open modellen uit onder Apache 2.0
- DeepSeek publiceert de gewichten en inferentiecode onder de MIT-licentie, al zijn de trainingsdata niet vrijgegeven, waardoor het formeel geen open source AI volgens de OSI-definitie is
- Mistral brengt een deel van zijn modellen uit onder Apache 2.0
- Llama van Meta valt onder een eigen communitylicentie met een grens voor zeer grote platformen, dus lees die voorwaarden voordat je erop bouwt
Let op het verschil tussen open weights en open source. Bij open weights krijg je het model en mag je het draaien, maar niet altijd zien waarop het getraind is. Voor de meeste zakelijke toepassingen is dat geen probleem, voor een AI Act-dossier over herkomst kan het dat wel worden. Wat de AI Act van jou verwacht, staat in ons artikel over de verplichtingen vanaf 2 augustus 2026.
Wat je er praktisch voor nodig hebt
De drempel is lager dan veel mensen denken. gpt-oss-20b is ontworpen om te draaien op apparaten met 16 GB geheugen en laadt in zijn eigen MXFP4-precisie in ongeveer 14 GB. Het grotere gpt-oss-120b past met dezelfde quantisatie op een enkele GPU van 80 GB, het type kaart dat je per uur huurt of als investering koopt.
Vertaald naar een keuze:
- Een kleiner model op eigen hardware volstaat voor samenvatten, classificeren, doorzoeken van documenten en het ondersteunen van klantenservicemedewerkers
- Voor zwaar redeneerwerk, complexe codegeneratie of agentische taken zijn de grote gesloten modellen vaak nog merkbaar beter
- Een hybride opzet komt het meest voor: gevoelige documentstromen lokaal, algemene taken via een cloudmodel
Wat vaker onderschat wordt dan de hardware is het werk eromheen: documenten ontsluiten, rechten afdwingen per gebruiker, versiebeheer van prompts en monitoring. Dat is precies dezelfde discipline die we beschrijven bij intelligente documentverwerking.
Wanneer de cloud gewoon de betere keuze is
Lokale AI is geen doel op zich. In deze gevallen adviseren we gewoon een cloudmodel:
- Je gebruik is laag of onvoorspelbaar; dan betaal je bij eigen hardware vooral voor stilstand
- Je hebt de allerbeste redeneerkwaliteit nodig en je data is niet bijzonder gevoelig
- Je hebt geen team dat een model, de bijbehorende updates en de beveiliging kan beheren
- Je wilt eerst valideren of de toepassing uberhaupt waarde oplevert, want dat valideer je sneller met een API
Een verstandige route is beginnen in de cloud met duidelijke verwerkersafspraken, meten wat het gebruik werkelijk is en pas overstappen als het volume of de gevoeligheid van de data daarom vraagt. Wat een AI-toepassing kost in beide varianten hebben we uitgewerkt bij AI-agent kosten.
Hoe wij lokale AI bouwen
Onze aanpak bij lokale AI-projecten kent vier stappen:
- Inventariseren welke datastromen echt gevoelig zijn; vaak is dat een kleiner deel dan gedacht en hoeft niet alles lokaal
- Een model kiezen op basis van taak en licentie, niet op basis van benchmarkscores alleen
- De omgeving inrichten met toegangsrechten per gebruiker, logging van elke vraag en een duidelijke bewaartermijn
- Meten en bijstellen, want het gebruik in maand drie ziet er anders uit dan de pilot
Die logging is geen bijzaak. Zowel voor de AI Act als voor ISO 27001-trajecten moet je kunnen laten zien wat er is gevraagd, door wie en wat het systeem heeft geantwoord. Bouw je AI-agents die zelf acties uitvoeren, dan wordt dat nog belangrijker.
Wil je weten of lokale AI in jouw situatie de juiste keuze is, plan dan een gesprek. We lopen je datastromen langs, rekenen beide varianten door en zijn eerlijk als de cloud voor jou goedkoper en verstandiger is.