Um runtime de inferência. Hardware diferente.
A EuLLM é a camada que torna a IA local independente do hardware — o mesmo runtime, a mesma API, de sistemas desktop a aceleradores enterprise.
O runtime por trás de cada Local AI Appliance
A I3K constrói o hardware. A EuLLM é o software que corre sobre ele: o motor de inferência, o catálogo de modelos e a camada de API que lhe permitem executar LLMs e outras cargas de trabalho de IA inteiramente na sua própria infraestrutura.
- Inferência totalmente local — sem ida e volta à cloud, nenhum dado sai da sua infraestrutura
- API compatível com OpenAI — substituto direto para ferramentas e frameworks de agentes existentes
- Gestão de modelos com catálogo de modelos GGUF integrado
- Abstração de hardware entre CPU, memória unificada e GPU dedicada
- Validado em AMD, NVIDIA e outros aceleradores
- Suporte multi-GPU para modelos maiores e maior concorrência
- Escolha o hardware por capacidade (modelos grandes) ou por desempenho (baixa latência)
- Substitua o hardware subjacente mais tarde — mesma API, mesma aplicação, zero reescrita
- Alimenta a RAG Enterprise, agentes e aplicações externas através de uma única API
- Sem custo por token imposto pela EuLLM quando o modelo corre localmente
Duas formas de dimensionar uma Local AI Appliance
Arquitetura capacity
Grandes pools de memória unificada para carregar modelos muito grandes na íntegra, sem offloading.
Ryzen AI Max+ 395 — 128 GB de memória unificada. Uma futura plataforma chegará até 192 GB.
Arquitetura performance
GPUs dedicadas com maior largura de banda de memória, concebidas para inferência interativa de baixa latência.
Acelerador de 32 GB · acelerador duplo de 64 GB · acelerador enterprise de 96 GB
Configurações das appliances
EuLLM Capacity 128
128 GB de memória unificada
EuLLM Performance 32
32 GB de memória GPU
EuLLM Performance 64
64 GB de memória GPU agregada
EuLLM Enterprise 96
96 GB de memória GPU ECC
EuLLM Capacity 192
Brevemente
O débito e a concorrência dependem do modelo, da quantização, do comprimento do contexto e do hardware. Só publicamos números de benchmark depois de testar a EuLLM diretamente nas configurações finais — não antes.
Como tudo se encaixa
“As aplicações integram-se com a EuLLM, não com um fornecedor de GPU específico.”
É isso que permite à I3K escolher, a qualquer momento, o acelerador com a melhor relação de preço, memória, desempenho e disponibilidade — sem nunca pedir que uma aplicação seja reescrita.
A RAG Enterprise corre sobre a EuLLM, não dentro dela
A RAG Enterprise, os frameworks de agentes e outras aplicações de negócio comunicam com a EuLLM através da API compatível com OpenAI. São aplicações construídas sobre o runtime, não fazem parte do motor de inferência core.
O que é core, o que se licencia separadamente
O core da EuLLM
As atualizações do core e o suporte a novos modelos/backends fazem parte da subscrição de manutenção.
Módulos de aplicação
Agentes avançados, plataforma de voz, document intelligence e outros módulos licenciam-se separadamente através da I3K / RAG Enterprise.
Execute IA local no seu próprio hardware
A EuLLM é open-source e corre em qualquer lugar. A I3K empacota-a em appliances dimensionadas para a sua carga de trabalho.
Com tecnologia EuLLM. Disponível através da I3K Local AI.
