Aangedreven door EuLLM · Beschikbaar via I3K

Eén inferentieruntime. Verschillende hardware.

EuLLM is de laag die lokale AI hardwareonafhankelijk maakt — dezelfde runtime, dezelfde API, van desktopsystemen tot enterprise-versnellers.

Runtime

De runtime achter elke Local AI Appliance

I3K bouwt de hardware. EuLLM is de software die erop draait: de inferentie-engine, de modelcatalogus en de API-laag waarmee u LLM's en andere AI-workloads volledig op uw eigen infrastructuur uitvoert.

  • Volledig lokale inferentie — geen cloud-roundtrip, geen data verlaat uw infrastructuur
  • OpenAI-compatibele API — drop-in voor bestaande tools en agent-frameworks
  • Modelbeheer met ingebouwde GGUF-modelcatalogus
  • Hardware-abstractie over CPU, unified memory en discrete GPU
  • Gevalideerd op AMD, NVIDIA en andere versnellers
  • Multi-GPU-ondersteuning voor grotere modellen en meer gelijktijdigheid
  • Kies hardware op capaciteit (grote modellen) of prestaties (lage latency)
  • Vervang later de onderliggende hardware — dezelfde API, dezelfde applicatie, geen herbouw
  • Drijft RAG Enterprise, agents en externe applicaties aan via één API
  • Geen kosten per token vanuit EuLLM wanneer het model lokaal draait
Architecturen

Twee manieren om een Local AI Appliance te dimensioneren

Capacity-architectuur

Grote unified-memory-pools om zeer grote modellen in hun geheel te laden, zonder offloading.

Ryzen AI Max+ 395 — 128 GB unified memory. Een toekomstig platform breidt dit uit tot 192 GB.

Performance-architectuur

Dedicated GPU's met hogere geheugenbandbreedte, gebouwd voor interactieve inferentie met lage latency.

32 GB-versneller · 64 GB dual-versneller · 96 GB enterprise-versneller

Configuraties

Appliance-configuraties

EuLLM Capacity 128

128 GB unified memory

EuLLM Performance 32

32 GB GPU-geheugen

EuLLM Performance 64

64 GB gecombineerd GPU-geheugen

EuLLM Enterprise 96

96 GB ECC GPU-geheugen

EuLLM Capacity 192

Binnenkort beschikbaar

Doorvoer en gelijktijdigheid zijn afhankelijk van het model, de kwantisering, de contextlengte en de hardware. We publiceren benchmarkcijfers pas nadat we EuLLM rechtstreeks op de definitieve configuraties hebben getest — niet eerder.

Architectuur

Hoe het in elkaar past

Bedrijfsapplicaties · Agents · RAG Enterprise
OpenAI-compatibele API
EuLLM
Modelruntime · scheduler · modelcatalogus
CPU · AMD · NVIDIA · multi-versneller hardware

Applicaties integreren met EuLLM, niet met een specifieke GPU-leverancier.

Daardoor kan I3K op elk moment de versneller kiezen met de beste verhouding tussen prijs, geheugen, prestaties en beschikbaarheid — zonder ooit een applicatie te hoeven herschrijven.

Applicaties

RAG Enterprise draait op EuLLM, niet erin

RAG Enterprise, agent-frameworks en andere bedrijfsapplicaties communiceren met EuLLM via de OpenAI-compatibele API. Het zijn applicaties gebouwd bovenop de runtime, geen onderdeel van de kern-inferentie-engine.

Licenties

Wat is core, wat wordt apart gelicentieerd

EuLLM-kern

Kernupdates en ondersteuning voor nieuwe modellen/backends maken deel uit van het onderhoudsabonnement.

Applicatiemodules

Geavanceerde agents, voice-platform, document intelligence en andere modules worden apart gelicentieerd via I3K / RAG Enterprise.

Draai lokale AI op uw eigen hardware

EuLLM is open-source en draait overal. I3K verpakt het in appliances afgestemd op uw workload.

Aangedreven door EuLLM. Beschikbaar via I3K Local AI.