Propulsé par EuLLM · Disponible via I3K

Un runtime d'inférence. Du matériel différent.

EuLLM est la couche qui rend l'IA locale indépendante du matériel — même runtime, même API, des systèmes desktop aux accélérateurs enterprise.

Runtime

Le runtime derrière chaque Local AI Appliance

I3K construit le matériel. EuLLM est le logiciel qui tourne dessus : le moteur d'inférence, le catalogue de modèles et la couche API qui vous permettent d'exécuter des LLM et d'autres charges de travail IA entièrement sur votre propre infrastructure.

  • Inférence entièrement locale — aucun aller-retour vers le cloud, aucune donnée ne quitte votre infrastructure
  • API compatible OpenAI — s'intègre directement à vos outils et frameworks d'agents existants
  • Gestion des modèles avec un catalogue de modèles GGUF intégré
  • Abstraction matérielle sur CPU, mémoire unifiée et GPU dédié
  • Validé sur AMD, NVIDIA et d'autres accélérateurs
  • Support multi-GPU pour des modèles plus grands et davantage de concurrence
  • Choisissez le matériel pour la capacité (grands modèles) ou la performance (faible latence)
  • Remplacez le matériel sous-jacent plus tard — même API, même application, zéro réécriture
  • Alimente RAG Enterprise, les agents et les applications externes via une seule API
  • Aucun coût par token imposé par EuLLM lorsque le modèle tourne en local
Architectures

Deux façons de dimensionner une Local AI Appliance

Architecture capacity

De grands pools de mémoire unifiée pour charger des modèles très volumineux en entier, sans offloading.

Ryzen AI Max+ 395 — 128 Go de mémoire unifiée. Une future plateforme ira jusqu'à 192 Go.

Architecture performance

Des GPU dédiés avec une bande passante mémoire plus élevée, conçus pour l'inférence interactive à faible latence.

Accélérateur 32 Go · double accélérateur 64 Go · accélérateur enterprise 96 Go

Configurations

Configurations des appliances

EuLLM Capacity 128

128 Go de mémoire unifiée

EuLLM Performance 32

32 Go de mémoire GPU

EuLLM Performance 64

64 Go de mémoire GPU agrégée

EuLLM Enterprise 96

96 Go de mémoire GPU ECC

EuLLM Capacity 192

Bientôt disponible

Le débit et la concurrence dépendent du modèle, de la quantification, de la longueur de contexte et du matériel. Nous ne publions des chiffres de benchmark qu'après avoir testé EuLLM directement sur les configurations finales — pas avant.

Architecture

Comment tout s'articule

Applications métier · Agents · RAG Enterprise
API compatible OpenAI
EuLLM
Runtime du modèle · ordonnanceur · catalogue de modèles
CPU · AMD · NVIDIA · matériel multi-accélérateur

Les applications s'intègrent à EuLLM, pas à un fournisseur GPU spécifique.

C'est ce qui permet à I3K de choisir, à tout moment, l'accélérateur offrant le meilleur rapport prix, mémoire, performance et disponibilité — sans jamais demander à une application d'être réécrite.

Applications

RAG Enterprise tourne sur EuLLM, pas à l'intérieur

RAG Enterprise, les frameworks d'agents et les autres applications métier communiquent avec EuLLM via l'API compatible OpenAI. Ce sont des applications construites au-dessus du runtime, pas une partie du moteur d'inférence core.

Licences

Ce qui est core, ce qui se licencie séparément

Le core d'EuLLM

Les mises à jour du core et le support de nouveaux modèles/backends font partie de l'abonnement de maintenance.

Modules applicatifs

Agents avancés, plateforme voice, document intelligence et autres modules se licencient séparément via I3K / RAG Enterprise.

Exécutez l'IA locale sur votre propre matériel

EuLLM est open-source et fonctionne partout. I3K le conditionne en appliances dimensionnées pour votre charge de travail.

Propulsé par EuLLM. Disponible via I3K Local AI.