Angetrieben von EuLLM · VerfĂŒgbar ĂŒber I3K

Eine Inferenz-Laufzeitumgebung. Unterschiedliche Hardware.

EuLLM ist die Schicht, die lokale KI hardwareunabhĂ€ngig macht — dieselbe Laufzeitumgebung, dieselbe API, von Desktop-Systemen bis zu Enterprise-Beschleunigern.

Laufzeitumgebung

Die Laufzeitumgebung hinter jeder Local AI Appliance

I3K baut die Hardware. EuLLM ist die Software, die darauf lĂ€uft: die Inferenz-Engine, der Modellkatalog und die API-Schicht, mit denen Sie LLMs und andere KI-Workloads vollstĂ€ndig auf Ihrer eigenen Infrastruktur ausfĂŒhren.

  • VollstĂ€ndig lokale Inferenz — kein Cloud-Roundtrip, keine Daten verlassen Ihre Infrastruktur
  • OpenAI-kompatible API — direkter Ersatz fĂŒr bestehende Tools und Agenten-Frameworks
  • Modellverwaltung mit integriertem GGUF-Modellkatalog
  • Hardware-Abstraktion ĂŒber CPU, Unified Memory und dedizierte GPU
  • Validiert auf AMD, NVIDIA und anderen Beschleunigern
  • Multi-GPU-UnterstĂŒtzung fĂŒr grĂ¶ĂŸere Modelle und höhere NebenlĂ€ufigkeit
  • WĂ€hlen Sie Hardware nach KapazitĂ€t (große Modelle) oder Performance (geringe Latenz)
  • Tauschen Sie die zugrunde liegende Hardware spĂ€ter aus — gleiche API, gleiche Anwendung, keine Neuentwicklung
  • Treibt RAG Enterprise, Agenten und externe Anwendungen ĂŒber eine einzige API an
  • Keine Pro-Token-Kosten durch EuLLM, wenn das Modell lokal lĂ€uft
Architekturen

Zwei Wege, eine Local AI Appliance zu dimensionieren

Capacity-Architektur

Große Unified-Memory-Pools, um sehr große Modelle vollstĂ€ndig zu laden, ohne Offloading.

Ryzen AI Max+ 395 — 128 GB Unified Memory. Eine zukĂŒnftige Plattform erweitert dies auf bis zu 192 GB.

Performance-Architektur

Dedizierte GPUs mit höherer Speicherbandbreite, gebaut fĂŒr interaktive Inferenz mit geringer Latenz.

32-GB-Beschleuniger · 64-GB-Dual-Beschleuniger · 96-GB-Enterprise-Beschleuniger

Konfigurationen

Appliance-Konfigurationen

EuLLM Capacity 128

128 GB Unified Memory

EuLLM Performance 32

32 GB GPU-Speicher

EuLLM Performance 64

64 GB aggregierter GPU-Speicher

EuLLM Enterprise 96

96 GB ECC-GPU-Speicher

EuLLM Capacity 192

DemnĂ€chst verfĂŒgbar

Durchsatz und NebenlĂ€ufigkeit hĂ€ngen vom Modell, der Quantisierung, der KontextlĂ€nge und der Hardware ab. Wir veröffentlichen Benchmark-Zahlen erst, nachdem wir EuLLM direkt auf den finalen Konfigurationen getestet haben — nicht vorher.

Architektur

Wie alles zusammenpasst

Business-Anwendungen · Agenten · RAG Enterprise
OpenAI-kompatible API
EuLLM
Modell-Laufzeitumgebung · Scheduler · Modellkatalog
CPU · AMD · NVIDIA · Multi-Beschleuniger-Hardware

“Anwendungen integrieren sich mit EuLLM, nicht mit einem bestimmten GPU-Anbieter.”

Das ermöglicht es I3K, jederzeit den Beschleuniger mit dem besten VerhĂ€ltnis aus Preis, Speicher, Performance und VerfĂŒgbarkeit zu wĂ€hlen — ohne dass eine Anwendung neu geschrieben werden muss.

Anwendungen

RAG Enterprise lÀuft auf EuLLM, nicht darin

RAG Enterprise, Agenten-Frameworks und andere Business-Anwendungen kommunizieren mit EuLLM ĂŒber die OpenAI-kompatible API. Es sind Anwendungen, die auf der Laufzeitumgebung aufbauen, nicht Teil der Kern-Inferenz-Engine.

Lizenzierung

Was zum Kern gehört, was separat lizenziert wird

EuLLM-Kern

Kern-Updates und die UnterstĂŒtzung neuer Modelle/Backends sind Teil des Wartungsabonnements.

Anwendungsmodule

Erweiterte Agenten, Voice-Plattform, Document Intelligence und weitere Module werden separat ĂŒber I3K / RAG Enterprise lizenziert.

FĂŒhren Sie lokale KI auf Ihrer eigenen Hardware aus

EuLLM ist Open Source und lĂ€uft ĂŒberall. I3K verpackt es in Appliances, die auf Ihren Workload zugeschnitten sind.

Angetrieben von EuLLM. VerfĂŒgbar ĂŒber I3K Local AI.