Com tecnologia EuLLM · Disponível através da I3K

Um runtime de inferência. Hardware diferente.

A EuLLM é a camada que torna a IA local independente do hardware — o mesmo runtime, a mesma API, de sistemas desktop a aceleradores enterprise.

Runtime

O runtime por trás de cada Local AI Appliance

A I3K constrói o hardware. A EuLLM é o software que corre sobre ele: o motor de inferência, o catálogo de modelos e a camada de API que lhe permitem executar LLMs e outras cargas de trabalho de IA inteiramente na sua própria infraestrutura.

  • Inferência totalmente local — sem ida e volta à cloud, nenhum dado sai da sua infraestrutura
  • API compatível com OpenAI — substituto direto para ferramentas e frameworks de agentes existentes
  • Gestão de modelos com catálogo de modelos GGUF integrado
  • Abstração de hardware entre CPU, memória unificada e GPU dedicada
  • Validado em AMD, NVIDIA e outros aceleradores
  • Suporte multi-GPU para modelos maiores e maior concorrência
  • Escolha o hardware por capacidade (modelos grandes) ou por desempenho (baixa latência)
  • Substitua o hardware subjacente mais tarde — mesma API, mesma aplicação, zero reescrita
  • Alimenta a RAG Enterprise, agentes e aplicações externas através de uma única API
  • Sem custo por token imposto pela EuLLM quando o modelo corre localmente
Arquiteturas

Duas formas de dimensionar uma Local AI Appliance

Arquitetura capacity

Grandes pools de memória unificada para carregar modelos muito grandes na íntegra, sem offloading.

Ryzen AI Max+ 395 — 128 GB de memória unificada. Uma futura plataforma chegará até 192 GB.

Arquitetura performance

GPUs dedicadas com maior largura de banda de memória, concebidas para inferência interativa de baixa latência.

Acelerador de 32 GB · acelerador duplo de 64 GB · acelerador enterprise de 96 GB

Configurações

Configurações das appliances

EuLLM Capacity 128

128 GB de memória unificada

EuLLM Performance 32

32 GB de memória GPU

EuLLM Performance 64

64 GB de memória GPU agregada

EuLLM Enterprise 96

96 GB de memória GPU ECC

EuLLM Capacity 192

Brevemente

O débito e a concorrência dependem do modelo, da quantização, do comprimento do contexto e do hardware. Só publicamos números de benchmark depois de testar a EuLLM diretamente nas configurações finais — não antes.

Arquitetura

Como tudo se encaixa

Aplicações de negócio · Agentes · RAG Enterprise
API compatível com OpenAI
EuLLM
Runtime do modelo · scheduler · catálogo de modelos
CPU · AMD · NVIDIA · hardware multi-acelerador

As aplicações integram-se com a EuLLM, não com um fornecedor de GPU específico.

É isso que permite à I3K escolher, a qualquer momento, o acelerador com a melhor relação de preço, memória, desempenho e disponibilidade — sem nunca pedir que uma aplicação seja reescrita.

Aplicações

A RAG Enterprise corre sobre a EuLLM, não dentro dela

A RAG Enterprise, os frameworks de agentes e outras aplicações de negócio comunicam com a EuLLM através da API compatível com OpenAI. São aplicações construídas sobre o runtime, não fazem parte do motor de inferência core.

Licenciamento

O que é core, o que se licencia separadamente

O core da EuLLM

As atualizações do core e o suporte a novos modelos/backends fazem parte da subscrição de manutenção.

Módulos de aplicação

Agentes avançados, plataforma de voz, document intelligence e outros módulos licenciam-se separadamente através da I3K / RAG Enterprise.

Execute IA local no seu próprio hardware

A EuLLM é open-source e corre em qualquer lugar. A I3K empacota-a em appliances dimensionadas para a sua carga de trabalho.

Com tecnologia EuLLM. Disponível através da I3K Local AI.