L’intelligenza artificiale non vive più soltanto nel cloud. Oggi è possibile costruire una workstation capace di eseguire modelli linguistici avanzati direttamente in locale, con un investimento inferiore ai 2.000 euro. E, per molti casi d’uso, ha più senso di quanto si possa pensare.

Fino a poco tempo fa parlare di intelligenza artificiale significava parlare di cloud.
Ogni richiesta passava da un’API, ogni documento veniva elaborato su un’infrastruttura remota e ogni nuovo progetto comportava un costo proporzionale all’utilizzo.
Era il modello naturale. E, per molti casi, continua a esserlo.
Negli ultimi mesi, però, mi sono accorto che la domanda sta cambiando.
Non è più soltanto quale modello scegliere o quale API costa meno.
Sempre più spesso è questa:
Ha ancora senso usare il cloud per tutto?
La risposta, almeno per come la vedo oggi, è no.
Non perché il cloud stia diventando meno importante. Al contrario, continuerà a essere indispensabile per i modelli più grandi e per molti servizi gestiti.
Ma perché esiste un numero crescente di attività che possono essere svolte direttamente sul proprio computer, mantenendo dati, documenti e codice all’interno della propria infrastruttura.
È questo, probabilmente, il cambiamento più interessante degli ultimi anni.
Perché proprio adesso?
Ci sono almeno tre fattori che stanno rendendo possibile questa evoluzione.
Il primo riguarda i modelli.
Famiglie come Llama, Qwen, Mistral, Gemma e DeepSeek hanno dimostrato che un modello open weight può essere sufficientemente maturo per molte attività quotidiane: sviluppo software, sistemi RAG, analisi documentale, assistenti personali e automazione.
Il secondo riguarda gli strumenti.
Software come Ollama, LM Studio e llama.cpp hanno abbassato enormemente la barriera d’ingresso. Installare un modello locale oggi richiede pochi minuti, senza configurazioni particolarmente complesse.
Il terzo fattore è l’hardware.
Il mercato dell’usato ha reso accessibili schede video che fino a pochi anni fa erano considerate fuori portata. È qui che il rapporto tra costo e prestazioni cambia davvero.
La risorsa più importante non è la CPU
Quando si assembla un computer si tende a guardare subito il processore.
Con gli LLM il componente decisivo è quasi sempre un altro: la memoria della GPU.
Ogni modello deve essere caricato in memoria durante l’esecuzione. Se non entra nella VRAM disponibile, parte del lavoro viene spostata sulla RAM del sistema, con un impatto evidente sulle prestazioni.
Per questo motivo, oggi, una GPU con 24 GB di VRAM rappresenta uno dei punti di equilibrio più interessanti.
Grazie alla quantizzazione è possibile eseguire modelli molto più grandi rispetto alla loro dimensione originale.
In termini pratici:
- modelli da 7B-8B funzionano senza difficoltà;
- la fascia 14B-22B è oggi quella più interessante per un utilizzo professionale;
- modelli da 70B richiedono configurazioni più complesse o più GPU.
La dimensione, però, non racconta tutta la storia.
Un modello più piccolo e specializzato può offrire risultati migliori di uno molto più grande, se addestrato per il compito giusto.
Desktop o notebook?
Per questo tipo di utilizzo il desktop continua a essere la scelta più razionale.
Il motivo è semplice: la memoria video.
Molte GPU montate sui notebook dispongono di meno VRAM rispetto alle equivalenti desktop. Una RTX 4090 per notebook, ad esempio, offre generalmente 16 GB di memoria, contro i 24 GB della versione desktop.
La differenza incide direttamente sulla dimensione dei modelli che è possibile eseguire.
Un desktop offre inoltre maggiore possibilità di aggiornamento, una dissipazione migliore e un mercato dell’usato molto più interessante.
In cambio bisogna accettare consumi più elevati e una minore portabilità.
Tre configurazioni sotto i 2.000 euro
RTX 3090: il miglior equilibrio
Se oggi dovessi consigliare una sola configurazione, partirei da qui.
Una RTX 3090 da 24 GB, acquistata usata, rappresenta probabilmente il miglior rapporto tra prezzo e prestazioni disponibile.
Con un budget compreso tra 1.400 e 1.700 euro è possibile assemblare una workstation con:
- RTX 3090 24 GB;
- Ryzen 9 oppure Intel Core i7 di fascia alta;
- 64 GB di RAM;
- SSD NVMe da 2 TB.
È una configurazione adatta a sviluppatori, consulenti e professionisti che vogliono utilizzare modelli locali in modo continuativo.
Workstation ricondizionata
Chi preferisce una macchina già pronta può orientarsi verso workstation professionali ricondizionate.
Serie come Dell Precision, HP Z o Lenovo ThinkStation sono progettate per lavorare molte ore consecutive e offrono una buona affidabilità.
Con una RTX A5000 da 24 GB, 64 o 128 GB di RAM e un SSD veloce, è possibile rimanere entro i 2.000 euro.
È una soluzione interessante soprattutto per piccoli team o ambienti professionali.
Due RTX 3090
Chi desidera lavorare con modelli ancora più grandi può valutare una configurazione con due RTX 3090.
In questo modo si arriva a 48 GB di VRAM complessiva, sufficienti per affrontare modelli molto più impegnativi.
È però una configurazione che richiede maggiore attenzione: consumi elevati, alimentatore adeguato, dissipazione efficace e una configurazione software più articolata.
La consiglierei solo a chi ha esigenze specifiche.
Attenzione all’usato
L’hardware usato permette di ridurre sensibilmente il budget, ma richiede qualche verifica.
Molte GPU provengono da attività di mining.
Non significa che siano da evitare, ma è opportuno controllare lo stato delle ventole, le temperature sotto carico e le condizioni generali della scheda.
Quando possibile, preferisco acquistare da rivenditori professionali che offrano almeno una garanzia minima.
Il vero vantaggio non è soltanto la privacy
Quando si parla di AI locale si pensa subito alla riservatezza dei dati.
È sicuramente un vantaggio.
Ma, secondo me, non è quello più interessante.
Il cambiamento riguarda il modo in cui iniziamo a utilizzare l’intelligenza artificiale.
Gli agenti AI non eseguono una sola richiesta. Pianificano, leggono documenti, scrivono codice, verificano il risultato, correggono gli errori e ripetono il processo.
Se ogni passaggio passa da un’API a consumo, il costo cresce rapidamente.
Una workstation locale cambia questa dinamica.
Non elimina il cloud.
Lo utilizza quando serve davvero e mantiene tutto il resto all’interno della propria infrastruttura.
È un approccio diverso, non una sostituzione.
Conclusione
Per anni il cloud è stato l’unica strada percorribile.
Oggi non è più così.
Con meno di 2.000 euro è possibile costruire una workstation capace di eseguire modelli linguistici avanzati in locale e affrontare molte attività quotidiane senza dipendere da servizi esterni.
Non sarà la soluzione giusta per tutti.
Ma credo che siamo all’inizio di un cambiamento simile a quello che abbiamo visto con i personal computer.
All’inizio erano strumenti per pochi appassionati.
Poi sono diventati la normalità.
Mi chiedo se, tra qualche anno, avere un modello di intelligenza artificiale che gira sul proprio computer non ci sembrerà altrettanto naturale.