Un runtime de inferencia. Hardware diferente.
EuLLM es la capa que hace que la IA local sea independiente del hardware — el mismo runtime, la misma API, desde sistemas de escritorio hasta aceleradores enterprise.
El runtime detrás de cada Local AI Appliance
I3K construye el hardware. EuLLM es el software que se ejecuta sobre él: el motor de inferencia, el catálogo de modelos y la capa API que le permiten ejecutar LLM y otras cargas de trabajo de IA enteramente en su propia infraestructura.
- Inferencia totalmente local — sin ida y vuelta a la nube, ningún dato sale de su infraestructura
- API compatible con OpenAI — sustitución directa para herramientas y frameworks de agentes existentes
- Gestión de modelos con catálogo de modelos GGUF integrado
- Abstracción de hardware entre CPU, memoria unificada y GPU dedicada
- Validado en AMD, NVIDIA y otros aceleradores
- Soporte multi-GPU para modelos más grandes y mayor concurrencia
- Elija el hardware por capacidad (modelos grandes) o por rendimiento (baja latencia)
- Sustituya el hardware subyacente más adelante — misma API, misma aplicación, cero reescritura
- Impulsa RAG Enterprise, agentes y aplicaciones externas a través de una única API
- Sin coste por token impuesto por EuLLM cuando el modelo se ejecuta en local
Dos formas de dimensionar una Local AI Appliance
Arquitectura capacity
Grandes pools de memoria unificada para cargar modelos muy grandes por completo, sin offloading.
Ryzen AI Max+ 395 — 128 GB de memoria unificada. Una futura plataforma llegará hasta 192 GB.
Arquitectura performance
GPUs dedicadas con mayor ancho de banda de memoria, diseñadas para inferencia interactiva de baja latencia.
Acelerador de 32 GB · doble acelerador de 64 GB · acelerador enterprise de 96 GB
Configuraciones de las appliances
EuLLM Capacity 128
128 GB de memoria unificada
EuLLM Performance 32
32 GB de memoria GPU
EuLLM Performance 64
64 GB de memoria GPU agregada
EuLLM Enterprise 96
96 GB de memoria GPU ECC
EuLLM Capacity 192
Próximamente
El throughput y la concurrencia dependen del modelo, la cuantización, la longitud de contexto y el hardware. Solo publicamos cifras de benchmark después de probar EuLLM directamente en las configuraciones finales, no antes.
Cómo encaja todo
“Las aplicaciones se integran con EuLLM, no con un proveedor de GPU específico.”
Eso es lo que permite a I3K elegir, en cada momento, el acelerador con la mejor relación de precio, memoria, rendimiento y disponibilidad, sin pedir nunca que se reescriba ninguna aplicación.
RAG Enterprise se ejecuta sobre EuLLM, no dentro de él
RAG Enterprise, los frameworks de agentes y otras aplicaciones de negocio hablan con EuLLM a través de la API compatible con OpenAI. Son aplicaciones construidas sobre el runtime, no forman parte del motor de inferencia core.
Qué es core, qué se licencia por separado
El core de EuLLM
Las actualizaciones del core y el soporte de nuevos modelos/backends forman parte de la suscripción de mantenimiento.
Módulos de aplicación
Agentes avanzados, plataforma de voz, document intelligence y otros módulos se licencian por separado a través de I3K / RAG Enterprise.
Ejecute IA local en su propio hardware
EuLLM es open-source y se ejecuta en cualquier lugar. I3K lo empaqueta en appliances dimensionadas para su carga de trabajo.
Con tecnología de EuLLM. Disponible a través de I3K Local AI.
