Con tecnología de EuLLM · Disponible a través de I3K

Un runtime de inferencia. Hardware diferente.

EuLLM es la capa que hace que la IA local sea independiente del hardware — el mismo runtime, la misma API, desde sistemas de escritorio hasta aceleradores enterprise.

Runtime

El runtime detrás de cada Local AI Appliance

I3K construye el hardware. EuLLM es el software que se ejecuta sobre él: el motor de inferencia, el catálogo de modelos y la capa API que le permiten ejecutar LLM y otras cargas de trabajo de IA enteramente en su propia infraestructura.

  • Inferencia totalmente local — sin ida y vuelta a la nube, ningún dato sale de su infraestructura
  • API compatible con OpenAI — sustitución directa para herramientas y frameworks de agentes existentes
  • Gestión de modelos con catálogo de modelos GGUF integrado
  • Abstracción de hardware entre CPU, memoria unificada y GPU dedicada
  • Validado en AMD, NVIDIA y otros aceleradores
  • Soporte multi-GPU para modelos más grandes y mayor concurrencia
  • Elija el hardware por capacidad (modelos grandes) o por rendimiento (baja latencia)
  • Sustituya el hardware subyacente más adelante — misma API, misma aplicación, cero reescritura
  • Impulsa RAG Enterprise, agentes y aplicaciones externas a través de una única API
  • Sin coste por token impuesto por EuLLM cuando el modelo se ejecuta en local
Arquitecturas

Dos formas de dimensionar una Local AI Appliance

Arquitectura capacity

Grandes pools de memoria unificada para cargar modelos muy grandes por completo, sin offloading.

Ryzen AI Max+ 395 — 128 GB de memoria unificada. Una futura plataforma llegará hasta 192 GB.

Arquitectura performance

GPUs dedicadas con mayor ancho de banda de memoria, diseñadas para inferencia interactiva de baja latencia.

Acelerador de 32 GB · doble acelerador de 64 GB · acelerador enterprise de 96 GB

Configuraciones

Configuraciones de las appliances

EuLLM Capacity 128

128 GB de memoria unificada

EuLLM Performance 32

32 GB de memoria GPU

EuLLM Performance 64

64 GB de memoria GPU agregada

EuLLM Enterprise 96

96 GB de memoria GPU ECC

EuLLM Capacity 192

Próximamente

El throughput y la concurrencia dependen del modelo, la cuantización, la longitud de contexto y el hardware. Solo publicamos cifras de benchmark después de probar EuLLM directamente en las configuraciones finales, no antes.

Arquitectura

Cómo encaja todo

Aplicaciones de negocio · Agentes · RAG Enterprise
API compatible con OpenAI
EuLLM
Runtime del modelo · planificador · catálogo de modelos
CPU · AMD · NVIDIA · hardware multi-acelerador

Las aplicaciones se integran con EuLLM, no con un proveedor de GPU específico.

Eso es lo que permite a I3K elegir, en cada momento, el acelerador con la mejor relación de precio, memoria, rendimiento y disponibilidad, sin pedir nunca que se reescriba ninguna aplicación.

Aplicaciones

RAG Enterprise se ejecuta sobre EuLLM, no dentro de él

RAG Enterprise, los frameworks de agentes y otras aplicaciones de negocio hablan con EuLLM a través de la API compatible con OpenAI. Son aplicaciones construidas sobre el runtime, no forman parte del motor de inferencia core.

Licencias

Qué es core, qué se licencia por separado

El core de EuLLM

Las actualizaciones del core y el soporte de nuevos modelos/backends forman parte de la suscripción de mantenimiento.

Módulos de aplicación

Agentes avanzados, plataforma de voz, document intelligence y otros módulos se licencian por separado a través de I3K / RAG Enterprise.

Ejecute IA local en su propio hardware

EuLLM es open-source y se ejecuta en cualquier lugar. I3K lo empaqueta en appliances dimensionadas para su carga de trabajo.

Con tecnología de EuLLM. Disponible a través de I3K Local AI.