Se negli ultimi mesi hai avuto la sensazione che l’intelligenza artificiale in cloud stia diventando sempre più cara e sempre meno “illimitata”, non è una tua impressione. Il modello di business dei grandi fornitori di AI si sta spostando rapidamente dal canone fisso al pagamento a consumo: più lavori, più paghi. E mentre paghi, ogni documento che carichi esce dal perimetro della tua azienda.
Esiste un’alternativa concreta, e non è un ritorno nostalgico al “server in cantina”: si chiama AI privata, ovvero modelli linguistici open source eseguiti su hardware che controlli tu. In questa guida ti spieghiamo perché sta diventando una scelta quasi obbligata per le PMI, quanto costa davvero e come costruire una macchina capace di farla girare partendo da hardware ricondizionato. Prima di iniziare, ti lasciamo il video in cui affrontiamo l’argomento nel nostro solito stile diretto: se preferisci l’approfondimento in formato video, parti da qui.
Oppure guardalo su YouTube
Cosa significa davvero “AI privata”
Partiamo dalle basi, perché intorno a questo tema circola parecchia confusione. Un’AI privata (o LLM locale, o AI on-premise) è un modello linguistico open source — come Llama, Mistral, Qwen o DeepSeek — scaricato ed eseguito su hardware controllato direttamente dall’azienda. Può essere un server nella tua sede, una workstation dedicata o, in alcuni casi, un cloud privato europeo isolato.
La differenza rispetto a un servizio come ChatGPT o Gemini non è la tecnologia in sé, ma dove avviene l’elaborazione e chi ne detiene il controllo. Nel primo caso il tuo prompt viaggia verso un datacenter che non conosci, in una giurisdizione che non scegli, e viene processato secondo regole che non decidi. Nel secondo caso, il prompt non esce mai dalla tua rete.
Inferenza locale non significa addestramento locale
Un chiarimento fondamentale, perché è qui che molti si spaventano inutilmente. Addestrare un modello linguistico da zero richiede infrastrutture da centinaia di milioni di euro: nessuna PMI lo farà mai, e nessuno te lo sta proponendo.
Quello che puoi fare in casa è l’inferenza, cioè la fase in cui il modello — già addestrato da altri e rilasciato con licenza open source — genera le risposte. È un’operazione infinitamente meno esigente dell’addestramento, e su hardware ben dimensionato gira senza problemi. In pratica: qualcun altro ha costruito il motore, tu lo metti nella tua macchina e lo guidi dove vuoi.
Perché l’AI in cloud sta diventando un problema per le aziende
Chiariamo subito una cosa: il cloud non è il male assoluto. Per certi carichi di lavoro — risorse di calcolo condivise, elasticità, picchi imprevedibili — è stata un’innovazione tecnica straordinaria, e chi lavora nel settore lo sa bene. Il problema nasce quando si passa dall’usare un servizio al dipendere da un servizio. E con l’AI questa soglia è stata superata in tempi record.
1. Dal canone fisso al pagamento a consumo
Il primo campanello d’allarme è economico. Fino a poco tempo fa l’abbonamento AI era semplice: pagavi una cifra fissa e usavi il servizio. Oggi il paradigma sta cambiando: si introducono tetti di utilizzo, quote di token e tier sempre più costosi. Superata la soglia, si va a consumo.
Non è un caso isolato: è la direzione dell’intero settore software. Prima si è passati dalla licenza perpetua all’abbonamento — pensa a come è cambiata la suite Office negli ultimi dieci anni — e ora si sta passando dall’abbonamento al consumo. Per un fornitore, affittare è più redditizio che vendere, e far pagare il consumo è più redditizio dell’affitto. È la stessa parabola che abbiamo già vissuto con la telefonia: prima le bollette a scatti, poi la concorrenza che ha riportato le tariffe flat. Con l’AI siamo ancora nella prima fase.
Cosa succede quando l’utilizzo cresce
Il vero rischio per un’azienda non è la bolletta di questo mese: è la sua imprevedibilità. Un’organizzazione che integra l’AI nei processi quotidiani — assistenza clienti, generazione documenti, analisi dati — vede il volume di richieste crescere in modo non lineare. E la spesa cresce con lui. Diverse analisi di settore riportano casi di aziende passate da poche centinaia a diverse migliaia di euro mensili in pochi mesi, semplicemente perché l’adozione interna è aumentata.
Il paradosso è evidente: più l’AI ti è utile, più ti costa. E il costo non lo controlli tu.
2. I tuoi dati escono dal perimetro aziendale
Il secondo tema è quello che dovrebbe preoccupare di più chi gestisce un’azienda. Ogni volta che carichi un contratto, un bilancio, un listino riservato o una procedura interna su una piattaforma esterna, quel documento esce dal tuo controllo diretto.
Non stiamo parlando di complottismo: le cause legali in corso sull’utilizzo di dati protetti da copyright per l’addestramento dei modelli sono pubbliche e numerose. Il principio è semplice: se stai regalando un dato che ha valore economico a un’azienda il cui business è basato sui dati, è ragionevole aspettarsi che quel dato venga valorizzato in qualche modo.
GDPR, AI Act e trasferimenti extra-UE
Sul piano normativo la questione è ancora più concreta. Il GDPR impone che il trattamento dei dati personali sia documentato, minimizzato e controllabile: inviare dati a un servizio AI extra-UE significa affidarsi a un Data Processing Agreement che spesso nessuno in azienda ha realmente letto, con server in giurisdizioni che non controlli.
A questo si è aggiunto l’AI Act europeo, il Regolamento (UE) 2024/1689, entrato in vigore nell’agosto 2024 con applicazione scaglionata: dal febbraio 2025 valgono i divieti sulle pratiche vietate e gli obblighi di alfabetizzazione del personale, dall’agosto 2025 le regole sui modelli general purpose, e dal 2 agosto 2026 è scattata l’applicazione generale con gli obblighi di trasparenza e l’impianto sanzionatorio. Gli obblighi sui sistemi ad alto rischio sono stati posticipati dal pacchetto Digital Omnibus al dicembre 2027 e all’agosto 2028, ma il messaggio per le imprese resta lo stesso: serve sapere quali sistemi AI si usano, con quali dati e con quali garanzie.
Tenere l’elaborazione dentro l’azienda non rende automaticamente “compliant” — servono comunque governance, hardening e tracciabilità — ma semplifica enormemente il quadro, perché elimina alla radice il problema del trasferimento transfrontaliero.
3. Il vendor lock-in: più lo usi, più diventi dipendente
Questo è l’aspetto più subdolo, perché non si manifesta subito. Dopo dodici mesi di progetti archiviati, prompt salvati, integrazioni costruite e flussi di lavoro adattati a una specifica piattaforma, cambiare fornitore non è più una scelta commerciale: è una migrazione con costi reali in ore-uomo e rischi operativi.
A quel punto, quando arriva l’aumento di prezzo o il cambio delle condizioni di servizio, la maggior parte delle aziende china la testa e paga. Perché l’alternativa costa di più. È esattamente il meccanismo che ha reso irreversibili tante altre dipendenze tecnologiche.
4. Sei limitato anche nelle funzionalità
Ultimo punto, spesso sottovalutato: un modello pubblico risponde nei termini decisi da chi lo gestisce. Ci sono filtri, policy e restrizioni che possono avere senso in generale, ma che in un contesto aziendale diventano un ostacolo.
Pensa a una domanda delicata sul posizionamento competitivo, a un’analisi di marginalità, a una simulazione su un contenzioso in corso, o anche solo a un consulto preliminare su un tema sanitario. Sono tutte richieste legittime, ma finiscono comunque registrate su un sistema esterno. Con un modello privato, la domanda resta dove è nata.
Ti serve davvero un modello di frontiera?
Ed eccoci al punto centrale, quello che rende l’AI privata economicamente sensata. La domanda giusta non è “il modello locale è potente quanto quello in cloud?”, perché la risposta è no. La domanda giusta è: per cosa mi serve?
Il test dell’80%
Se devi far girare una simulazione fluidodinamica o risolvere un problema di ricerca sofisticato, hai bisogno di un modello di frontiera e di potenza di calcolo fuori portata per qualunque PMI. Ma quante delle tue richieste quotidiane rientrano davvero in questa categoria?
La maggior parte del lavoro reale è fatta di:
- traduzioni e revisioni di testi
- sintesi di documenti, verbali e mail
- estrazione di dati da fatture, contratti e schede tecniche
- classificazione e smistamento di richieste
- bozze di risposte commerciali e assistenza clienti
- supporto su formule, procedure e documentazione interna
Per tutto questo non serve il modello più addestrato del pianeta. Usando un’analogia: non ti serve Einstein al fianco della scrivania, ti basta e avanza un buon professore. E se simulare Einstein richiede un datacenter, simulare un buon professore si può fare tranquillamente in azienda.
L’architettura ibrida: la soluzione più intelligente
Nella pratica, l’approccio che sta funzionando meglio nelle aziende non è “tutto locale” o “tutto cloud”, ma un modello ibrido: il modello privato gestisce i carichi sensibili e di routine — che sono la maggioranza — mentre le richieste di ragionamento complesso e non riservate vengono instradate verso un servizio esterno.
Il risultato è duplice: abbatti la spesa a consumo sulla grande maggioranza del traffico e tieni fuori dal cloud tutto ciò che è riservato, senza rinunciare alla potenza dei modelli di frontiera quando serve davvero.
Parametri e quantizzazione: come funziona un modello, spiegato semplice
Per dimensionare l’hardware servono due concetti. Sono meno complicati di quanto sembri.
I parametri
La complessità di un modello dipende in larga parte dal numero di parametri che contiene. Puoi immaginarli, con una semplificazione, come i “neuroni” della rete: più ce ne sono, più il modello è in grado di cogliere sfumature. Si misurano in miliardi (B, da billion): esistono modelli da 3B, 7B, 14B, 32B, 70B e oltre.
Per l’uso aziendale, la fascia interessante è quella tra i 7 e i 32 miliardi di parametri. È il punto di equilibrio tra qualità delle risposte e fabbisogno hardware realistico.
La quantizzazione
Il secondo fattore è il peso di ogni singolo parametro, cioè quanti bit vengono usati per rappresentarlo. Un modello nasce tipicamente a 16 bit per parametro, ma è possibile “comprimerlo” portandolo a 8, 5 o 4 bit. Questa operazione si chiama quantizzazione.
Il vantaggio è enorme: riducendo la precisione, il modello occupa molta meno memoria e gira su hardware molto più accessibile. Il costo è una lieve perdita di qualità, che nella pratica risulta spesso impercettibile nei casi d’uso aziendali. È uno scambio molto conveniente: si rinuncia a poco per guadagnare tantissimo in termini di risorse.
Le quantizzazioni più usate
- Q8 — qualità praticamente identica all’originale, ma pesante
- Q5 — ottimo compromesso, consigliato quando la VRAM lo consente
- Q4 — lo standard de facto per l’uso in locale: qualità solida, ingombro dimezzato rispetto a Q8
Quanta memoria serve, in concreto
Una regola pratica per stimare l’occupazione in VRAM di un modello quantizzato a 4 bit: moltiplica i miliardi di parametri per circa 0,6-0,7 GB, e aggiungi un margine per il contesto.
- Modello 7B in Q4 → circa 5-6 GB di VRAM
- Modello 14B in Q4 → circa 9-11 GB di VRAM
- Modello 32B in Q4 → circa 20-24 GB di VRAM
Da qui si capisce perché 32 GB di VRAM totali siano un obiettivo realistico e molto interessante: consentono di far girare comodamente modelli fino a 32B con contesti ampi.
La configurazione hardware: l’AI privata su server ricondizionato
Ecco la parte pratica. La buona notizia è che non serve un rack da datacenter: serve una macchina ben bilanciata, e il mercato del ricondizionato professionale offre esattamente i componenti giusti a una frazione del prezzo del nuovo.
La CPU: un buon Xeon basta
Nell’inferenza con GPU, il processore non è il collo di bottiglia: serve a gestire il sistema, il caricamento del modello e le operazioni di contorno. Un Intel Xeon di generazione recente, magari in configurazione dual socket, è più che sufficiente e si trova ricondizionato a cifre molto contenute. Se invece prevedi di far girare il modello parzialmente su CPU, allora il numero di core e la banda di memoria diventano più rilevanti.
La RAM: punta a 64 GB
64 GB di RAM ECC sono il punto di partenza sensato per una macchina di inferenza. Servono per caricare il modello, gestire il sistema operativo, l’eventuale database vettoriale e le richieste concorrenti. Va detto che i prezzi della memoria sono in una fase di rialzo, proprio a causa della domanda generata dall’AI: motivo in più per valutare l’acquisto di moduli ricondizionati certificati, dove il differenziale rispetto al nuovo è più marcato che mai.
Le GPU: qui si gioca la partita
La componente decisiva è la VRAM, la memoria dedicata delle schede grafiche. È lei a determinare quale modello puoi caricare.
Le schede professionali di generazione precedente, come le NVIDIA Quadro P5000 da 16 GB, si trovano oggi sul mercato dell’usato a prezzi molto interessanti. Montandone due si arriva a 32 GB di VRAM complessivi, sufficienti per far girare modelli di fascia media con ottimi risultati. Sono schede pensate per il funzionamento continuo, con dissipazione progettata per l’ambiente server: caratteristiche che contano quando la macchina deve lavorare tutto il giorno.
Se il budget lo consente, salire di generazione porta benefici in termini di velocità di generazione. Ma per iniziare, la regola resta: meglio più VRAM che più velocità. Un modello che non entra in memoria non gira; un modello che gira un po’ più lento è comunque perfettamente utilizzabile.
Alimentazione, spazio e raffreddamento
Tre dettagli che fanno la differenza tra un progetto che funziona e uno che si ferma dopo due settimane:
- Alimentatore adeguato, con margine sufficiente per due GPU sotto carico prolungato
- Chassis con spazio e flusso d’aria reali, perché due schede affiancate scaldano
- Scheda madre con slot PCIe sufficienti





