Admin e Utenti
interagiscono via UI.
Admin e utenti interagiscono con lo stack mediante una UI — GUI o CLI con manifest: chi entra, chi parla con quale modello, come scala l'inventario — e come lo rivendi con il tuo brand se fai da provider.
Chi usa cosa,
lo decidi tu.
Gira accanto al proxy, sulla tua infrastruttura. Da qui installi i modelli, emetti e revochi le chiavi, decidi chi può parlare con quale modello e vedi quanto consuma ciascuno — in tempo reale.

Utenti e accessi
Utenti attivi, scadenze e revoche per gruppo, dominio e tenant. Ogni API key ha proprietario, scope e scadenza — si revoca da qui. Auth dal tuo provider (Google Workspace, Entra ID, Okta, OIDC qualsiasi) con 2FA.

Ruoli e permessi (RBAC)
Quattro livelli — utente, developer, admin, superadmin — e una matrice endpoint-per-endpoint su chi può fare cosa. Sotto, le regole che legano utenti, gruppi, domini e tenant ai singoli modelli, con quota annessa.

Telemetria
Token al minuto ultime 24h, occupazione GPU/VRAM/potenza per nodo, consumo per utente. Allarmi sul canale che preferisci quando una soglia scatta o uno spot viene revocato.

Wiring esterni
I componenti opzionali si collegano da qui: OpenRAG e Qdrant con collection e modello di embedding, harness agentici con il modello a cui sono legati, wiring tool che spinge l’endpoint sui desktop del team.
La chat, le chiavi,
il wiring in un click.
L'utente finale non apre ticket: parla con i modelli in chat multimodale, ruota le proprie API key e incolla il wiring per Cursor, Cline, Continue o Muse — tutto sull'overlay cifrato, con le stesse quote dell'admin.

Chat harness multimodale
Harness in stile ChatGPT con streaming, allegati image/file, picker modello e tool cards che aprono chiavi, wiring o quote senza uscire dalla conversazione. Vision via Qwen3-VL 32B.

Le tue API key
Chiavi personali tenant-scoped, create e ruotate in un click con preview sk-…xxxx. Stessa chiave per OpenAI e Anthropic, revoca immediata e rotazione zero-downtime di 5 minuti.

Wiring per coding agent
Un copia-incolla per Cursor, Continue, Cline, Copilot, Codex, Muse e Windsurf: inietta OPENAI_BASE_URL / ANTHROPIC_BASE_URL e la tua chiave sull'overlay 10.88.0.0/16, QUIC + mTLS, nessun IP pubblico.

Playground modelli
Prova al volo ogni modello con system prompt, temperature e file: stesso proxy e stesse quote della chat, risposta in streaming mock pronta per la produzione.

Quota e consumo
Grafico a barre per ora, quote per modello e stima costi giornaliera — tutto tenant-wide, con reset a mezzanotte Europe/Rome.
Chi entra, e con quale chiave
L’anagrafica di chi può usare i tuoi modelli, organizzata come è fatta la tua azienda — o quella dei tuoi clienti.
Utenti
Stato attivo, scadenza e revoca immediata — uno per uno o in blocco.
Gruppi
Team o funzione: RBAC e quote si applicano al gruppo, non persona per persona.
Domini
Accesso legato al dominio email: chi arriva da @tuaazienda.com entra con le regole già pronte.
Tenant
Separazione completa fra organizzazioni sullo stesso pannello: dati, quote e modelli non si mescolano.
API token
Ogni chiave ha proprietario, scope e scadenza. Si crea, ruota e revoca da qui, senza toccare codice.
OAuth e SSO
Dal tuo provider — Google Workspace, Entra ID, Okta o OIDC qualsiasi — con 2FA applicabile in policy.
Chi può fare cosa, endpoint per endpoint
Non solo “chi entra”: decidi cosa può toccare, una volta dentro.
Quattro livelli
Utente, developer, admin e superadmin: ruoli per l’uso dei modelli e per l’amministrazione del pannello.
Permessi per endpoint
Matrice che dice, endpoint per endpoint, chi può leggere, scrivere o amministrare.
Regole di binding
Utenti, gruppi, domini e tenant legati ai singoli modelli con allow/deny espliciti.
Quota ereditata
Ogni regola porta una quota: il limite si applica a chiunque rientri in quel gruppo o tenant.
L’inventario che decide cosa gira, e come
Chat, multimodale ed embedding in un solo posto: dall’installazione alla messa a riposo.
Catalogo Ventic
Nuovo modello dai template pronti, già ottimizzati per l’hardware disponibile.
Inventario installato
Elenco modelli attivi con nodo, finestra di contesto, quota e repliche.
Quote e allow/deny
Limiti per utente/gruppo/tenant e liste esplicite di chi può chiamare un modello.
Scaling out e in
Repliche aggiunte o tolte a mano o su soglia, per assorbire picchi senza tenere GPU accese a vuoto.
Auto shutdown e start
Spegnimento quando nessuno lo usa, riavvio automatico alla prima richiesta.
Restrizioni semantiche
Parole e concetti vietati per modello, per policy di contenuto senza toccare il prompt.
Sorgenti RAG
Collection e basi di conoscenza collegate al modello direttamente da qui.
Tutto il consumo, sotto gli occhi
Non dashboard decorative: i numeri per capire se stai spendendo bene o stai per saturare.
Token al minuto
Andamento ultime 24 ore, per modello e in aggregato.
GPU, VRAM e potenza
Occupazione per nodo: dove spingi e dove hai margine.
Consumo per utente
Chi usa quanto — per addebitare o individuare abusi.
Allarmi in tempo reale
Notifica sul canale che preferisci quando una soglia scatta o uno spot viene revocato.
I componenti opzionali, collegati da qui
RAG e harness agentici non sono a parte: si agganciano al pannello come il resto.
OpenRAG e Qdrant
Collection sorgenti e modello di embedding che le indicizza, configurati dal pannello.
Harness agentici
Agenti e harness legati al modello a cui devono parlare, con le stesse regole RBAC.
Wiring tool
L’endpoint giusto arriva sui desktop del team — niente URL o chiavi da distribuire a mano.
Il tuo brand,
la nostra piattaforma.
Separazione per tenant fin dal primo giorno: amministri la tua azienda, oppure rivendi l’accesso ai tuoi clienti come fosse tuo.
Non serve un’infra separata per cliente: un pool di GPU, tanti tenant quanto servono.
Multi-tenant nativo
Ogni cliente è un tenant isolato: dati, utenti, modelli e consumi non si vedono fra tenant.
Rivendita come provider
Offri subscription o pacchetti a consumo usando la capacità che hai già comprato una volta.
Ruoli per il tuo supporto
Il tuo staff amministra tenant e clienti con ruoli admin, senza toccare il superadmin di piattaforma.
Fatturazione per tenant
Consumo e quote tracciati per tenant: la base per fatturare ogni cliente è già pronta.
Contattaci
per cominciare subito.
Ti aiutiamo a scegliere il setup giusto — BYOH con i tuoi server o PaaS con i nostri — e partiamo direttamente dal workload che vuoi portare in produzione. Accesso in Alpha stage su invito.