lokale AI

Lokale AI: wanneer hoort je model op eigen infrastructuur te draaien?

Geschrieben von Ruben Lucas Groothuis ·

Europa zet in 2026 stevig in op digitale soevereiniteit en open modellen zijn goed genoeg geworden voor zakelijk werk. Dat maakt de vraag concreet: laat je bedrijfsdata het pand verlaten of niet?

Lokale AI betekent dat je een taalmodel draait op hardware die jij beheert, op eigen servers of bij een Europese aanbieder, zodat prompts en documenten je omgeving niet verlaten. Dat is sinds 2026 realistisch geworden: open modellen met vrije licenties presteren goed genoeg voor zakelijk werk, en een model als gpt-oss-20b draait al op een machine met 16 GB geheugen. De keuze hangt af van je datagevoeligheid en je volume: bij vertrouwelijke documenten, ketenafspraken of een voorspelbaar hoog gebruik wint lokaal, bij wisselende volumes en zwaar redeneerwerk wint de cloud meestal nog op kosten.

Bekijk cases

Van principiele vraag naar praktische afweging

Twee jaar geleden was lokale AI vooral een principekwestie voor organisaties die hun data niet naar Amerikaanse cloudleveranciers wilden sturen. In 2026 is het een rekensom geworden. De Europese Commissie presenteerde op 3 juni 2026 een pakket voor technologische soevereiniteit, er ligt een meetbaar raamwerk om de soevereiniteit van cloudleveranciers te beoordelen, en de open modellen die je zelf mag draaien zijn goed genoeg voor het merendeel van het werk dat bedrijven ermee doen. In dit artikel leggen we uit wat er precies veranderd is, welke modellen en licenties er zijn, wat je aan hardware nodig hebt en wanneer je juist beter in de cloud kunt blijven.

Warum lokale AI bei Score Agency?

Data blijft binnen je grenzen

Prompts, documenten en antwoorden verlaten je eigen netwerk of je Europese omgeving niet, wat een hoop verwerkersvragen eenvoudiger maakt.

Voorspelbare kosten

Je betaalt voor hardware of een vaste server, niet per token. Bij hoog en stabiel gebruik is dat makkelijker te begroten.

Geen leveranciersafhankelijkheid

Open modellen met een Apache- of MIT-licentie mag je commercieel draaien en zelf bijtrainen, zonder dat een prijswijziging je businesscase omgooit.

Aantoonbaar voor auditors

Je kunt precies laten zien waar data staat en wie erbij kan, wat helpt bij ISO 27001-trajecten en ketenvragen.

Klaar voor Europese eisen

Het EU-raamwerk voor cloudsoevereiniteit maakt inkoopeisen concreet. Wie dat nu regelt is voorbereid op aanbestedingen en ketenafspraken.

Wat lokale AI precies is

Lokale AI is het draaien van een taalmodel op infrastructuur die jij beheert. Dat kan een server in je eigen serverruimte zijn, maar in de praktijk is het vaker een afgesloten omgeving bij een hostingpartij binnen de EU. Het onderscheid dat telt is niet de fysieke locatie maar de vraag wie bij de data kan en onder welk recht dat valt.

Drie varianten kom je tegen:

- Volledig lokaal: het model draait op je eigen hardware, er gaat geen enkele byte naar buiten
- Eigen omgeving bij een Europese aanbieder: je huurt rekenkracht, maar het model en de data staan in jouw omgeving en worden niet gedeeld
- Cloud-API met verwerkersafspraken: je gebruikt een model van een grote aanbieder met contractuele waarborgen over bewaren en trainen

Alle drie zijn verdedigbare keuzes. Het verschil zit in hoeveel je zelf moet regelen en hoeveel je op papier kunt aantonen. Wij bouwden met IntraGPT een lokale AI-omgeving waarin medewerkers met bedrijfsdocumenten kunnen werken zonder dat die documenten de organisatie verlaten.

Wat Europa in 2026 heeft besloten

Op 3 juni 2026 presenteerde de Europese Commissie het pakket voor technologische soevereiniteit. Dat bestaat uit vier onderdelen:

- Chips Act 2.0 voor halfgeleidercapaciteit
- De Cloud and AI Development Act, die datacenterbouw in Europa moet versnellen en een gezamenlijk beoordelingskader voor cloud- en AI-soevereiniteit vastlegt
- Een open source-strategie die overheden aanmoedigt open alternatieven te gebruiken
- Een routekaart voor digitalisering en AI in de energiesector

Het meest concrete doel: de datacentercapaciteit in de EU moet binnen vijf tot zeven jaar verdrievoudigen, met kortere vergunningsprocedures. De achterliggende gedachte is steeds dezelfde, in de woorden van Commissievoorzitter Von der Leyen: Europa kan zich niet permitteren afhankelijk te zijn van anderen voor de technologie die ziekenhuizen en energienetten draaiende houdt.

Voor bedrijven is dit geen verplichting, maar wel een richting. Wie levert aan overheden of aan organisaties die onder de Cyberbeveiligingswet vallen, krijgt dit soort vragen steeds vaker via de keten binnen.

De vier soevereiniteitsniveaus uit het EU-raamwerk

Het Cloud Sovereignty Framework maakt soevereiniteit voor het eerst meetbaar. Leveranciers worden beoordeeld op acht dimensies, waaronder juridische controle, operationele onafhankelijkheid, transparantie in de toeleveringsketen, technologische openheid, beveiliging en duurzaamheid. Daarbovenop staan vier oplopende zekerheidsniveaus:

- Niveau 1: verwerking vindt plaats op EU-infrastructuur
- Niveau 2: aantoonbare onafhankelijkheid van derde landen, met transparantie daarover
- Niveau 3: eigendom en zeggenschap liggen in de EU
- Niveau 4: volledige ketentransparantie zonder inmenging vanuit derde landen

Dat het geen papieren exercitie is, bleek in april 2026: de Commissie gunde op basis van dit raamwerk voor 180 miljoen euro aan soevereine clouddiensten over zes jaar aan vier Europese partijen, waaronder Scaleway, StackIT, Proximus en een consortium rond Post Telecom met OVHcloud en CleverCloud.

Praktisch nut voor jou: gebruik deze niveaus als vragenlijst bij je eigen leveranciers. Ze dwingen een concreet antwoord af op de vraag waar je data staat en wie er juridisch bij kan.

Welke open modellen bruikbaar zijn en onder welke licentie

De licentie bepaalt of je een model commercieel mag draaien en of je het mag bijtrainen. Dat is bij open modellen niet overal hetzelfde:

- gpt-oss-120b en gpt-oss-20b van OpenAI verschenen in augustus 2025 onder Apache 2.0, een van de ruimste licenties
- Qwen van Alibaba brengt sinds Qwen3 alle open modellen uit onder Apache 2.0
- DeepSeek publiceert de gewichten en inferentiecode onder de MIT-licentie, al zijn de trainingsdata niet vrijgegeven, waardoor het formeel geen open source AI volgens de OSI-definitie is
- Mistral brengt een deel van zijn modellen uit onder Apache 2.0
- Llama van Meta valt onder een eigen communitylicentie met een grens voor zeer grote platformen, dus lees die voorwaarden voordat je erop bouwt

Let op het verschil tussen open weights en open source. Bij open weights krijg je het model en mag je het draaien, maar niet altijd zien waarop het getraind is. Voor de meeste zakelijke toepassingen is dat geen probleem, voor een AI Act-dossier over herkomst kan het dat wel worden. Wat de AI Act van jou verwacht, staat in ons artikel over de verplichtingen vanaf 2 augustus 2026.

Wat je er praktisch voor nodig hebt

De drempel is lager dan veel mensen denken. gpt-oss-20b is ontworpen om te draaien op apparaten met 16 GB geheugen en laadt in zijn eigen MXFP4-precisie in ongeveer 14 GB. Het grotere gpt-oss-120b past met dezelfde quantisatie op een enkele GPU van 80 GB, het type kaart dat je per uur huurt of als investering koopt.

Vertaald naar een keuze:

- Een kleiner model op eigen hardware volstaat voor samenvatten, classificeren, doorzoeken van documenten en het ondersteunen van klantenservicemedewerkers
- Voor zwaar redeneerwerk, complexe codegeneratie of agentische taken zijn de grote gesloten modellen vaak nog merkbaar beter
- Een hybride opzet komt het meest voor: gevoelige documentstromen lokaal, algemene taken via een cloudmodel

Wat vaker onderschat wordt dan de hardware is het werk eromheen: documenten ontsluiten, rechten afdwingen per gebruiker, versiebeheer van prompts en monitoring. Dat is precies dezelfde discipline die we beschrijven bij intelligente documentverwerking.

Wanneer de cloud gewoon de betere keuze is

Lokale AI is geen doel op zich. In deze gevallen adviseren we gewoon een cloudmodel:

- Je gebruik is laag of onvoorspelbaar; dan betaal je bij eigen hardware vooral voor stilstand
- Je hebt de allerbeste redeneerkwaliteit nodig en je data is niet bijzonder gevoelig
- Je hebt geen team dat een model, de bijbehorende updates en de beveiliging kan beheren
- Je wilt eerst valideren of de toepassing uberhaupt waarde oplevert, want dat valideer je sneller met een API

Een verstandige route is beginnen in de cloud met duidelijke verwerkersafspraken, meten wat het gebruik werkelijk is en pas overstappen als het volume of de gevoeligheid van de data daarom vraagt. Wat een AI-toepassing kost in beide varianten hebben we uitgewerkt bij AI-agent kosten.

Hoe wij lokale AI bouwen

Onze aanpak bij lokale AI-projecten kent vier stappen:

- Inventariseren welke datastromen echt gevoelig zijn; vaak is dat een kleiner deel dan gedacht en hoeft niet alles lokaal
- Een model kiezen op basis van taak en licentie, niet op basis van benchmarkscores alleen
- De omgeving inrichten met toegangsrechten per gebruiker, logging van elke vraag en een duidelijke bewaartermijn
- Meten en bijstellen, want het gebruik in maand drie ziet er anders uit dan de pilot

Die logging is geen bijzaak. Zowel voor de AI Act als voor ISO 27001-trajecten moet je kunnen laten zien wat er is gevraagd, door wie en wat het systeem heeft geantwoord. Bouw je AI-agents die zelf acties uitvoeren, dan wordt dat nog belangrijker.

Wil je weten of lokale AI in jouw situatie de juiste keuze is, plan dan een gesprek. We lopen je datastromen langs, rekenen beide varianten door en zijn eerlijk als de cloud voor jou goedkoper en verstandiger is.

Unsere Projekte

Alle Projekte ansehen

Seit über 15 Jahren Partner für digitale Transformation

Score Agency ist eine Full-Service-Digitalagentur, die seit über 15 Jahren Unternehmen bei ihrer digitalen Transformation unterstützt. Mit unserer Expertise in Softwareentwicklung, Webdesign und KI-Lösungen entwickeln wir Lösungen, die wirklich Impact machen.

Wir glauben an Transparenz, Qualität und langfristige Partnerschaften. Keine versteckten Kosten, keine unrealistischen Versprechen, sondern ehrliche Beratung und Lösungen, die funktionieren.

150+
Projekte geliefert
15+
Jahre Erfahrung

Ergebnisorientiert

Wir messen Erfolg an Ihren Ergebnissen

Alles über lokale ai

Lokale AI is een taalmodel dat draait op infrastructuur die jij beheert, op eigen servers of in een afgesloten omgeving bij een Europese aanbieder. Prompts, documenten en antwoorden blijven daardoor binnen je eigen omgeving in plaats van naar een externe API te gaan.
Voor samenvatten, classificeren, doorzoeken van documenten en het ondersteunen van medewerkers zijn open modellen in 2026 ruim voldoende. Voor zwaar redeneerwerk en complexe codegeneratie presteren de grote gesloten modellen nog merkbaar beter. Een hybride opzet is daarom gebruikelijk.
Een kleiner model als gpt-oss-20b is ontworpen voor apparaten met 16 GB geheugen. Het grotere gpt-oss-120b past met MXFP4-quantisatie op een enkele GPU van 80 GB. Voor veel zakelijke toepassingen volstaat het kleinere model.
Dat hangt van de licentie af. Modellen onder Apache 2.0 of MIT, zoals gpt-oss, Qwen vanaf Qwen3 en DeepSeek, mag je commercieel draaien. Llama van Meta kent een eigen communitylicentie met voorwaarden voor zeer grote platformen, dus die moet je vooraf lezen.
Dat is het Europese raamwerk waarmee de soevereiniteit van cloudleveranciers meetbaar wordt gemaakt, op acht dimensies en met vier oplopende zekerheidsniveaus. De Europese Commissie gebruikte het in april 2026 bij een aanbesteding van 180 miljoen euro aan soevereine clouddiensten.
Bij laag of wisselend gebruik meestal wel, want je betaalt voor capaciteit die stilstaat. Bij hoog en stabiel gebruik draait dat om, omdat je niet per token betaalt. Reken beide varianten door op basis van je verwachte volume voordat je kiest.

Bereit, mit lokale AI zu starten?

Nehmen Sie noch heute Kontakt auf und erfahren Sie, wie wir Ihnen mit lokale AI helfen können. Keine Verpflichtungen, nur ehrliche Beratung.

053-870 0020