Eine Inferenz-Laufzeitumgebung. Unterschiedliche Hardware.
EuLLM ist die Schicht, die lokale KI hardwareunabhĂ€ngig macht â dieselbe Laufzeitumgebung, dieselbe API, von Desktop-Systemen bis zu Enterprise-Beschleunigern.
Die Laufzeitumgebung hinter jeder Local AI Appliance
I3K baut die Hardware. EuLLM ist die Software, die darauf lĂ€uft: die Inferenz-Engine, der Modellkatalog und die API-Schicht, mit denen Sie LLMs und andere KI-Workloads vollstĂ€ndig auf Ihrer eigenen Infrastruktur ausfĂŒhren.
- VollstĂ€ndig lokale Inferenz â kein Cloud-Roundtrip, keine Daten verlassen Ihre Infrastruktur
- OpenAI-kompatible API â direkter Ersatz fĂŒr bestehende Tools und Agenten-Frameworks
- Modellverwaltung mit integriertem GGUF-Modellkatalog
- Hardware-Abstraktion ĂŒber CPU, Unified Memory und dedizierte GPU
- Validiert auf AMD, NVIDIA und anderen Beschleunigern
- Multi-GPU-UnterstĂŒtzung fĂŒr gröĂere Modelle und höhere NebenlĂ€ufigkeit
- WĂ€hlen Sie Hardware nach KapazitĂ€t (groĂe Modelle) oder Performance (geringe Latenz)
- Tauschen Sie die zugrunde liegende Hardware spĂ€ter aus â gleiche API, gleiche Anwendung, keine Neuentwicklung
- Treibt RAG Enterprise, Agenten und externe Anwendungen ĂŒber eine einzige API an
- Keine Pro-Token-Kosten durch EuLLM, wenn das Modell lokal lÀuft
Zwei Wege, eine Local AI Appliance zu dimensionieren
Capacity-Architektur
GroĂe Unified-Memory-Pools, um sehr groĂe Modelle vollstĂ€ndig zu laden, ohne Offloading.
Ryzen AI Max+ 395 â 128 GB Unified Memory. Eine zukĂŒnftige Plattform erweitert dies auf bis zu 192 GB.
Performance-Architektur
Dedizierte GPUs mit höherer Speicherbandbreite, gebaut fĂŒr interaktive Inferenz mit geringer Latenz.
32-GB-Beschleuniger · 64-GB-Dual-Beschleuniger · 96-GB-Enterprise-Beschleuniger
Appliance-Konfigurationen
EuLLM Capacity 128
128 GB Unified Memory
EuLLM Performance 32
32 GB GPU-Speicher
EuLLM Performance 64
64 GB aggregierter GPU-Speicher
EuLLM Enterprise 96
96 GB ECC-GPU-Speicher
EuLLM Capacity 192
DemnĂ€chst verfĂŒgbar
Durchsatz und NebenlĂ€ufigkeit hĂ€ngen vom Modell, der Quantisierung, der KontextlĂ€nge und der Hardware ab. Wir veröffentlichen Benchmark-Zahlen erst, nachdem wir EuLLM direkt auf den finalen Konfigurationen getestet haben â nicht vorher.
Wie alles zusammenpasst
âAnwendungen integrieren sich mit EuLLM, nicht mit einem bestimmten GPU-Anbieter.â
Das ermöglicht es I3K, jederzeit den Beschleuniger mit dem besten VerhĂ€ltnis aus Preis, Speicher, Performance und VerfĂŒgbarkeit zu wĂ€hlen â ohne dass eine Anwendung neu geschrieben werden muss.
RAG Enterprise lÀuft auf EuLLM, nicht darin
RAG Enterprise, Agenten-Frameworks und andere Business-Anwendungen kommunizieren mit EuLLM ĂŒber die OpenAI-kompatible API. Es sind Anwendungen, die auf der Laufzeitumgebung aufbauen, nicht Teil der Kern-Inferenz-Engine.
Was zum Kern gehört, was separat lizenziert wird
EuLLM-Kern
Kern-Updates und die UnterstĂŒtzung neuer Modelle/Backends sind Teil des Wartungsabonnements.
Anwendungsmodule
Erweiterte Agenten, Voice-Plattform, Document Intelligence und weitere Module werden separat ĂŒber I3K / RAG Enterprise lizenziert.
FĂŒhren Sie lokale KI auf Ihrer eigenen Hardware aus
EuLLM ist Open Source und lĂ€uft ĂŒberall. I3K verpackt es in Appliances, die auf Ihren Workload zugeschnitten sind.
Angetrieben von EuLLM. VerfĂŒgbar ĂŒber I3K Local AI.
