Eén inferentieruntime. Verschillende hardware.
EuLLM is de laag die lokale AI hardwareonafhankelijk maakt — dezelfde runtime, dezelfde API, van desktopsystemen tot enterprise-versnellers.
De runtime achter elke Local AI Appliance
I3K bouwt de hardware. EuLLM is de software die erop draait: de inferentie-engine, de modelcatalogus en de API-laag waarmee u LLM's en andere AI-workloads volledig op uw eigen infrastructuur uitvoert.
- Volledig lokale inferentie — geen cloud-roundtrip, geen data verlaat uw infrastructuur
- OpenAI-compatibele API — drop-in voor bestaande tools en agent-frameworks
- Modelbeheer met ingebouwde GGUF-modelcatalogus
- Hardware-abstractie over CPU, unified memory en discrete GPU
- Gevalideerd op AMD, NVIDIA en andere versnellers
- Multi-GPU-ondersteuning voor grotere modellen en meer gelijktijdigheid
- Kies hardware op capaciteit (grote modellen) of prestaties (lage latency)
- Vervang later de onderliggende hardware — dezelfde API, dezelfde applicatie, geen herbouw
- Drijft RAG Enterprise, agents en externe applicaties aan via één API
- Geen kosten per token vanuit EuLLM wanneer het model lokaal draait
Twee manieren om een Local AI Appliance te dimensioneren
Capacity-architectuur
Grote unified-memory-pools om zeer grote modellen in hun geheel te laden, zonder offloading.
Ryzen AI Max+ 395 — 128 GB unified memory. Een toekomstig platform breidt dit uit tot 192 GB.
Performance-architectuur
Dedicated GPU's met hogere geheugenbandbreedte, gebouwd voor interactieve inferentie met lage latency.
32 GB-versneller · 64 GB dual-versneller · 96 GB enterprise-versneller
Appliance-configuraties
EuLLM Capacity 128
128 GB unified memory
EuLLM Performance 32
32 GB GPU-geheugen
EuLLM Performance 64
64 GB gecombineerd GPU-geheugen
EuLLM Enterprise 96
96 GB ECC GPU-geheugen
EuLLM Capacity 192
Binnenkort beschikbaar
Doorvoer en gelijktijdigheid zijn afhankelijk van het model, de kwantisering, de contextlengte en de hardware. We publiceren benchmarkcijfers pas nadat we EuLLM rechtstreeks op de definitieve configuraties hebben getest — niet eerder.
Hoe het in elkaar past
“Applicaties integreren met EuLLM, niet met een specifieke GPU-leverancier.”
Daardoor kan I3K op elk moment de versneller kiezen met de beste verhouding tussen prijs, geheugen, prestaties en beschikbaarheid — zonder ooit een applicatie te hoeven herschrijven.
RAG Enterprise draait op EuLLM, niet erin
RAG Enterprise, agent-frameworks en andere bedrijfsapplicaties communiceren met EuLLM via de OpenAI-compatibele API. Het zijn applicaties gebouwd bovenop de runtime, geen onderdeel van de kern-inferentie-engine.
Wat is core, wat wordt apart gelicentieerd
EuLLM-kern
Kernupdates en ondersteuning voor nieuwe modellen/backends maken deel uit van het onderhoudsabonnement.
Applicatiemodules
Geavanceerde agents, voice-platform, document intelligence en andere modules worden apart gelicentieerd via I3K / RAG Enterprise.
Draai lokale AI op uw eigen hardware
EuLLM is open-source en draait overal. I3K verpakt het in appliances afgestemd op uw workload.
Aangedreven door EuLLM. Beschikbaar via I3K Local AI.
