Un runtime di inferenza. Hardware diverso.
EuLLM è il livello che rende l'AI locale indipendente dall'hardware — stesso runtime, stessa API, da sistemi desktop ad acceleratori enterprise.
Il runtime dietro ogni Local AI Appliance
I3K costruisce l'hardware. EuLLM è il software che ci gira sopra: il motore di inferenza, il catalogo modelli e il livello API che ti permettono di eseguire LLM e altri workload AI interamente sulla tua infrastruttura.
- Inferenza completamente locale — nessun round-trip verso il cloud, nessun dato lascia la tua infrastruttura
- API compatibile OpenAI — drop-in per strumenti e framework agentici esistenti
- Model management con catalogo modelli GGUF integrato
- Hardware abstraction su CPU, memoria unificata e GPU discrete
- Validato su AMD, NVIDIA e altri acceleratori
- Supporto multi-GPU per modelli più grandi e maggiore concorrenza
- Scegli l'hardware per capacità (modelli grandi) o per performance (bassa latenza)
- Sostituisci l'hardware in futuro — stessa API, stessa applicazione, zero riscritture
- Alimenta RAG Enterprise, agenti e applicazioni esterne attraverso un'unica API
- Nessun costo per token imposto da EuLLM quando il modello gira in locale
Due modi di dimensionare una Local AI Appliance
Architettura capacity
Grandi pool di memoria unificata per caricare modelli molto grandi per intero, senza offloading.
Ryzen AI Max+ 395 — 128 GB di memoria unificata. Una futura piattaforma arriverà fino a 192 GB.
Architettura performance
GPU dedicate con maggiore bandwidth di memoria, pensate per inferenza interattiva a bassa latenza.
Acceleratore da 32 GB · doppio acceleratore da 64 GB · acceleratore enterprise da 96 GB
Configurazioni delle appliance
EuLLM Capacity 128
128 GB di memoria unificata
EuLLM Performance 32
32 GB di memoria GPU
EuLLM Performance 64
64 GB di memoria GPU aggregata
EuLLM Enterprise 96
96 GB di memoria GPU ECC
EuLLM Capacity 192
Prossimamente
Throughput e concorrenza dipendono dal modello, dalla quantizzazione, dal context e dall'hardware. Pubblichiamo numeri di benchmark solo dopo aver testato EuLLM direttamente sulle configurazioni finali — non prima.
Come si incastra tutto
“Le applicazioni si integrano con EuLLM, non con uno specifico vendor GPU.”
Questo è ciò che permette a I3K di scegliere nel tempo l'acceleratore con il miglior rapporto tra prezzo, memoria, performance e disponibilità — senza dover riscrivere nessuna applicazione.
RAG Enterprise gira su EuLLM, non al suo interno
RAG Enterprise, i framework di agenti e altre applicazioni business comunicano con EuLLM tramite l'API compatibile OpenAI. Sono applicazioni costruite sopra il runtime, non parte del motore di inferenza core.
Cosa è core, cosa si licenzia separatamente
Il core di EuLLM
Gli aggiornamenti core e il supporto a nuovi modelli/backend fanno parte dell'abbonamento di manutenzione.
Moduli applicativi
Agenti avanzati, piattaforma voice, document intelligence e altri moduli si licenziano separatamente tramite I3K / RAG Enterprise.
Esegui l'AI locale sul tuo hardware
EuLLM è open-source e gira ovunque. I3K lo confeziona in appliance dimensionate per il tuo workload.
Powered by EuLLM. Disponibile tramite I3K Local AI.
