Napędzane przez EuLLM · Dostępne przez I3K

Jeden runtime wnioskowania. Różny sprzęt.

EuLLM to warstwa, która czyni lokalną AI niezależną od sprzętu — ten sam runtime, to samo API, od systemów desktopowych po akceleratory enterprise.

Runtime

Runtime stojący za każdą Local AI Appliance

I3K buduje sprzęt. EuLLM to oprogramowanie, które na nim działa: silnik wnioskowania, katalog modeli i warstwa API, które pozwalają uruchamiać LLM i inne obciążenia AI całkowicie na własnej infrastrukturze.

  • W pełni lokalne wnioskowanie — bez przesyłania danych do chmury, żadne dane nie opuszczają Państwa infrastruktury
  • API kompatybilne z OpenAI — zamiennik dla istniejących narzędzi i frameworków agentowych
  • Zarządzanie modelami z wbudowanym katalogiem modeli GGUF
  • Abstrakcja sprzętowa obejmująca CPU, unified memory i dedykowane GPU
  • Zwalidowane na AMD, NVIDIA i innych akceleratorach
  • Wsparcie multi-GPU dla większych modeli i wyższej współbieżności
  • Wybór sprzętu pod kątem pojemności (duże modele) lub wydajności (niskie opóźnienia)
  • Wymiana sprzętu w przyszłości — to samo API, ta sama aplikacja, zero przepisywania
  • Napędza RAG Enterprise, agentów i zewnętrzne aplikacje poprzez jedno API
  • Brak kosztów za token narzucanych przez EuLLM, gdy model działa lokalnie
Architektury

Dwa sposoby doboru Local AI Appliance

Architektura capacity

Duże pule unified memory do wczytywania bardzo dużych modeli w całości, bez offloadingu.

Ryzen AI Max+ 395 — 128 GB unified memory. Przyszła platforma rozszerzy to do 192 GB.

Architektura performance

Dedykowane GPU o wyższej przepustowości pamięci, zaprojektowane do interaktywnego wnioskowania o niskim opóźnieniu.

Akcelerator 32 GB · podwójny akcelerator 64 GB · akcelerator enterprise 96 GB

Konfiguracje

Konfiguracje appliance

EuLLM Capacity 128

128 GB unified memory

EuLLM Performance 32

32 GB pamięci GPU

EuLLM Performance 64

64 GB zagregowanej pamięci GPU

EuLLM Enterprise 96

96 GB pamięci GPU ECC

EuLLM Capacity 192

Wkrótce

Przepustowość i współbieżność zależą od modelu, kwantyzacji, długości kontekstu i sprzętu. Publikujemy wyniki benchmarków dopiero po przetestowaniu EuLLM bezpośrednio na finalnych konfiguracjach — nie wcześniej.

Architektura

Jak to wszystko się łączy

Aplikacje biznesowe · Agenci · RAG Enterprise
API kompatybilne z OpenAI
EuLLM
Runtime modelu · scheduler · katalog modeli
CPU · AMD · NVIDIA · sprzęt multi-akceleratorowy

Aplikacje integrują się z EuLLM, a nie z konkretnym dostawcą GPU.

To właśnie pozwala I3K wybierać w danym momencie akcelerator o najlepszym stosunku ceny, pamięci, wydajności i dostępności — bez konieczności przepisywania jakiejkolwiek aplikacji.

Aplikacje

RAG Enterprise działa na EuLLM, a nie wewnątrz niego

RAG Enterprise, frameworki agentowe i inne aplikacje biznesowe komunikują się z EuLLM poprzez API kompatybilne z OpenAI. To aplikacje zbudowane na runtime, a nie część głównego silnika wnioskowania.

Licencjonowanie

Co jest core, co licencjonuje się osobno

Rdzeń EuLLM

Aktualizacje rdzenia oraz wsparcie nowych modeli/backendów są częścią subskrypcji utrzymania.

Moduły aplikacyjne

Zaawansowani agenci, platforma głosowa, document intelligence i inne moduły są licencjonowane osobno poprzez I3K / RAG Enterprise.

Uruchom lokalną AI na własnym sprzęcie

EuLLM jest open-source i działa wszędzie. I3K pakuje go w appliance dopasowane do Państwa obciążenia.

Napędzane przez EuLLM. Dostępne przez I3K Local AI.