Nessun prodotto
I prezzi sono IVA esclusa
Capacità o banda? Guida con i numeri misurati per chi deve scegliere la macchina su cui far girare l'intelligenza artificiale in azienda — aggiornata a settembre 2026 Da quando un modello linguistico si può far girare in ufficio, le domande di chi vuole portare l'intelligenza artificiale in azienda senza mandare i dati fuori sono cambiate. Un anno fa era «quanta VRAM serve?». Oggi sono queste: «Il DGX Spark ha 128 GB di memoria e la RTX 5090 ne ha 32: perché mi consigliate la scheda?» Sono domande giuste e hanno tutte la stessa radice: nel confronto tra memoria unificata e VRAM la memoria non è un numero solo, sono due. La capacità (i gigabyte) decide se un modello si carica. La banda (i gigabyte al secondo) decide quanto velocemente risponde. Il modello che vuoi usare, e il lavoro che gli chiedi, decidono quale dei due conta. È per questo che 128 GB non battono sempre 32 GB. E a volte sì. In questo articolo trovi i numeri misurati da fonti indipendenti (le discussioni ufficiali del progetto llama.cpp, i test di LMSYS, Level1Techs, Hardware Corner e altri, con data) sulle quattro macchine che un professionista o un responsabile IT confronta davvero oggi: RTX 5090, RTX PRO 6000, DGX Spark e i mini-PC con Ryzen AI Max+. Noi abbiamo a catalogo entrambe le famiglie, quella a memoria unificata e quella a GPU dedicata: non abbiamo una scatola da spingere, abbiamo una scelta da farti fare bene.
1. Cos'è la memoria unificata (e cosa non è)Una workstation tradizionale ha due memorie: la RAM di sistema, che serve al processore, e la VRAM, saldata accanto alla GPU. La VRAM di oggi è GDDR7, costruita per essere letta a più di un terabyte al secondo: su una RTX 5090 o una RTX PRO 6000 sono 1.792 GB/s. Un sistema a memoria unificata ha invece un unico pool condiviso da processore e GPU: è così il DGX Spark di NVIDIA (e i suoi cloni ASUS Ascent GX10, MSI EdgeXpert, Dell, HP, Lenovo), i mini-PC con AMD Ryzen AI Max+ 395 (Framework Desktop, HP Z2 Mini G1a e altri) e, da ottobre 2026, l'RTX Spark N1X per Windows. La memoria è LPDDR5X, la stessa famiglia dei portatili: efficiente, economica per gigabyte, ma molto più lenta della GDDR7. Lo Spark la legge a 273 GB/s, i Ryzen AI Max+ a 256. Quello che ottieni con la memoria unificata è concreto: tanti gigabyte, un modello da 60-120 GB che si carica intero, una scatola silenziosa che assorbe 120-240 W. Quello che non ottieni va detto con la stessa chiarezza. Primo: 128 GB non sono 128 GB di VRAM. Sistema operativo e processore ne tengono una parte, e sui Ryzen AI Max+ la quota per la GPU va configurata a mano (per default sono 16-32 GB). Secondo: non è espandibile. È saldata, e nel 2026 la LPDDR5X è la memoria più esposta ai rincari: NVIDIA ha alzato il prezzo dello Spark di 700 dollari a febbraio 2026 per la crisi delle memorie di cui abbiamo scritto, e a settembre i sistemi GB10 sono ancora difficili da trovare. Terzo: è un sistema chiuso. La macchina che compri è quella che tieni per tre anni, con i limiti tipici di un prodotto di marca: niente seconda GPU, niente RAM in più. 2. I due numeri che contano: capacità e banda di memoriaMettiamo in tabella le macchine di cui parliamo, con i dati di targa dichiarati dai produttori a settembre 2026:
Fonti: schede tecniche NVIDIA e AMD consultate il 7 settembre 2026; banda misurata dei Ryzen AI Max+ da Level1Techs. La banda della 5090 è calcolata dai dati di targa (bus a 512 bit, 28 Gbps). Perché la banda pesa così tanto? Per generare ogni singola parola, un modello linguistico viene riletto per intero dalla memoria. Quindi la velocità massima con cui ti risponde, per un utente alla volta, è semplicemente banda diviso dimensione del modello. Si misura in token al secondo (t/s): un token è più o meno tre quarti di una parola. Un modello da 27-32 miliardi di parametri compresso a 4 bit occupa circa 18 GB: 1.792 ÷ 18 fa circa 100 t/s su una RTX 5090 (in pratica 60-85, perché nessuna scheda sfrutta il 100% della banda), 273 ÷ 18 fa 15 su un DGX Spark (misurati: 11-12). La potenza di calcolo, i TFLOPS, i «TOPS», il «petaflop» del marketing non compaiono nella formula: in questa fase la GPU aspetta la memoria. Leggere un documento lungo è un altro lavoro (e qui conta il calcolo)Prima di rispondere, il modello deve «leggere» tutto quello che gli dai: la domanda, i documenti recuperati dall'archivio aziendale, il codice, la conversazione precedente. I tecnici la chiamano prefill (o prompt processing), e a differenza della generazione dipende dalla potenza di calcolo, perché migliaia di parole vengono elaborate in parallelo. Qui il divario tra GPU dedicata e memoria unificata è ancora più ampio: sullo stesso modello da 120 miliardi di parametri, una RTX PRO 6000 legge 4.500-5.500 token al secondo, lo Spark circa 1.950, un Ryzen AI Max+ tra 340 e 1.000 a seconda del software (misure llama.cpp). Tradotto in attesa: una domanda che porta al modello 12.000 token di documenti aziendali aspetta circa 7 secondi sullo Spark e 35 su un Ryzen AI Max+ (DataHardware, luglio 2026); con un modello da 32 miliardi e 50.000 token di contesto, la nostra stima è di una ventina di secondi su una 5090, oltre un minuto sullo Spark, circa quattro minuti su un Ryzen AI Max+. E lo paghi a ogni domanda. Il contesto occupa memoriaLa «memoria di lavoro» della conversazione (la KV cache) si aggiunge al modello: per un 32B classico sono circa 8 GB ogni 32.000 token di contesto, 32 GB a 128.000; per un 70B, 10 GB a 32.000. I modelli più recenti con architettura ibrida (Qwen3.8-27B, per esempio) ne usano un quarto. Quando ti chiedi se un modello «entra», devi contare anche questo: un 32B compresso da 20 GB con 32.000 token di contesto arriva a 28-29 GB. Entra in una 5090, di misura. 3. Quanti token al secondo servono per lavorare?Le soglie percepite da chi lavora con questi strumenti tutti i giorni convergono abbastanza:
Due cose che separano chi ha già provato da chi sta valutando. La prima: il tempo di lettura del prompt conta quanto la velocità di scrittura, e i benchmark «a contesto vuoto» non lo mostrano. La seconda: il contesto lungo rallenta tutto. Lo stesso gpt-oss-120b passa da 60 a 40 t/s sullo Spark quando la conversazione arriva a 32.000 token (misure llama.cpp, febbraio 2026). 4. Quando 128 GB battono 32 GBIl caso è uno: il modello che vuoi non entra in 32 GB. Un Llama 3.3 da 70 miliardi di parametri compresso a 4 bit pesa 42 GB; gpt-oss-120b, il modello aperto di OpenAI da 117 miliardi, ne occupa 61 (68 con il contesto al massimo); Qwen3-235B a 4 bit, 142 GB. Con una scheda da 32 GB questi modelli o non partono o, come vedremo, si trascinano. Con 128 GB partono. Ma «partire» e «lavorare» sono due cose diverse, e la differenza la fa l'architettura del modello. I modelli «a esperti» (MoE): tanta capacità, poca bandagpt-oss-120b ha 117 miliardi di parametri, ma per ogni parola ne usa solo 5,1 miliardi: è un modello Mixture of Experts, diviso in 128 «esperti» di cui ne attiva 4 alla volta. Nella formula della velocità, quindi, al denominatore non vanno i 61 GB totali ma i circa 4 GB letti davvero per ogni token. Serve tanta memoria per contenerlo tutto, ma poca banda per farlo girare: è esattamente il profilo dei sistemi a 128 GB unificati, e i numeri lo confermano.
Ecco il caso in cui la memoria unificata è utilizzabile sul serio: un modello da 117 miliardi di parametri a 40-60 token al secondo, in una scatola da 240 W, mentre la 5090 con lo stesso modello arranca a 9,6. Va detto tutto, però: la stessa cosa su 96 GB di GDDR7 va tre volte più veloce nella generazione e due-tre volte nella lettura dei prompt, perché anche i 4 GB attivi per token viaggiano a 1,79 TB/s. I 128 GB lenti vincono sui 32 GB veloci; perdono contro i 96 GB veloci. Prototipazione, fine-tuning, silenzioCi sono poi i motivi per cui consigliamo un DGX Spark anche a chi potrebbe permettersi una GPU dedicata. Lo Spark è un piccolo laboratorio CUDA: monta lo stesso software dei server NVIDIA, permette di sviluppare e fare fine-tuning (NVIDIA lo dichiara fino a 70 miliardi di parametri) su una scrivania, in silenzio; due unità in cluster caricano modelli da 235 miliardi di parametri a un utente (circa 12 t/s misurati). Chi lo ha comprato per chattare velocemente è rimasto deluso; chi lo ha comprato per prototipare quello che poi girerà in datacenter, no. 5. Quando 32 GB battono 128 GBTutto quello che entra gira cinque-sette volte più velocePrendiamo la classe di modelli che nel 2026 fa il lavoro quotidiano di uno studio o di una PMI: 27-32 miliardi di parametri, 16-20 GB compressi a 4 bit. Entra ovunque. E sullo stesso modello, per un utente alla volta, senza trucchi:
Il rapporto tra 5090 e Spark, a parità di software (SGLang, stesso formato a 4 bit, stesso modello Qwen3.8-27B), è di 85,8 contro 12,3 t/s: sette volte, esattamente il rapporto tra le due bande (1.792 ÷ 273 = 6,6). La fisica torna. Nella lettura dei prompt il rapporto è tre-quattro volte, nel lavoro reale con documenti lunghi la differenza si sente ancora di più. Il 70B che «entra» nei 128 GB, ma non lavoraÈ il numero che ha deluso più persone dall'autunno 2025. Un Llama 3.1 70B, il modello «serio» per antonomasia, sul DGX Spark genera 2,7 t/s in formato FP8 e 4,6 t/s compresso a 4 bit (LMSYS, ottobre 2025), su un Ryzen AI Max+ 4,5-5,1 t/s. Sotto la velocità con cui leggi. Lo stesso modello su una RTX PRO 6000 fa 27-32 t/s. La formula lo prevedeva: 273 GB/s diviso 70 GB fa 3,9. È il senso letterale del titolo di questo articolo: i 128 GB fanno entrare il modello grande, ma non lo fanno lavorare. I modelli che si usano davvero nel 2026 entrano in 32 GBQui sta il cambiamento che rende la domanda «grande e lento o medio e veloce?» quasi superata. I modelli aperti con cui si lavora oggi pesano 14-20 GB: Qwen3-Coder-30B-A3B (19 GB), gpt-oss-20b (14), Qwen3.8-27B (16), Gemma 4 31B (circa 18), Devstral Small 2 da 24 miliardi (14). E secondo le schede tecniche dei rispettivi produttori superano nettamente il 70B di fine 2024: sul test di ragionamento scientifico GPQA Diamond, Llama 3.3 70B si fermava a 50,5 punti, mentre Gemma 4 31B fa 84,3, Qwen3.6-35B-A3B 86,0 e Qwen3.8-27B 89,2; sulla programmazione (SWE-bench Verified) Devstral Small 2 fa 68,0 e Qwen3.6-35B-A3B 73,4. Sono punteggi dichiarati dai produttori e non replicati da terzi, da leggere come ordine di grandezza; ma i divari sono troppo ampi per essere un effetto del metodo di misura. Un modello da 16 GB fa oggi cose che un anno fa richiedevano 80-140 GB. Il modello quotidiano di uno studio o di un ufficio tecnico nel 2026 entra in 32 GB e ci gira a 60-90 token al secondo. Il 70B «denso» resta la scelta giusta solo per chi ha bisogno della sua conoscenza enciclopedica, e in quel caso serve una memoria insieme capiente e veloce (sezione 6). Più utenti, contesti lunghi, immaginiSe il modello serve a un reparto e non a una persona, la GPU dedicata allunga ancora. I motori server (vLLM, SGLang) leggono i pesi una volta sola per tutti gli utenti in coda e moltiplicano la produttività complessiva, ma serve potenza di calcolo, che una GPU Blackwell ha in abbondanza e un sistema unificato no. Con Llama 70B in FP8 e otto utenti insieme, una RTX PRO 6000 produce 153 t/s complessivi contro 20 dello Spark (LMSYS). Una RTX 5090 con vLLM serve oltre 30 persone in chat su un modello da 8 miliardi, o 6 su un 34B, con la prima parola sotto il mezzo secondo (GigaGPU, aprile 2026); una RTX PRO 6000 serve 50 richieste simultanee su un 32B a 17-19 t/s ciascuna (DatabaseMart, agosto 2026). E se la stessa macchina deve anche generare immagini o video, il discorso è chiuso in partenza: ne abbiamo scritto in VRAM per ComfyUI: come dimensionare la workstation, e perfino chi ha provato lo Spark per la generazione video (Hardware Upgrade, giugno 2026) nota che ogni operazione è più lenta che su una scheda grafica tradizionale. Il precipizio dei 32 GB (e il trucco della RAM doppia)Cosa succede se il modello sta in VRAM «quasi tutto»? Non va un po' più piano: crolla. Un 32B compresso con 6 GB fuori dalla VRAM dimezza la velocità (da circa 45 a circa 20 t/s); gpt-oss-120b su una 5090 con la suddivisione automatica dei layer fa 3,4 t/s. La ragione è nella tabella della sezione 2: la strada su cui finisce ciò che non entra, la RAM DDR5 a 90 GB/s o il bus PCIe a 63, è venti-trenta volte più lenta della GDDR7, e siccome ogni parola richiede tutti i pesi, il tratto lento detta il passo. Un modello un po' più piccolo che entra tutto è quasi sempre la scelta migliore di uno più grande che deborda. Da qui la regola che applichiamo a ogni workstation per l'AI: RAM di sistema almeno doppia rispetto alla VRAM, veloce e a due canali pieni. Serve a caricare i modelli, a tenere il contesto e, con i modelli a esperti, a fare qualcosa di più: tenere in VRAM la parte letta a ogni parola e lasciare gli esperti in RAM. Un test documentato su gpt-oss-120b con una scheda da soli 12 GB e 64 GB di DDR5 dà 25-28 t/s con la memoria a 6000 MT/s e 10-11 con la stessa memoria lasciata a 2000 (carteakey.dev, 2025-26): il triplo, solo attivando il profilo XMP. Una workstation con RTX 5090 e 96-192 GB di DDR5 veloce è l'alternativa PC ai box da 128 GB per i modelli a esperti: generazione nella stessa classe, lettura dei prompt molto più rapida, e resta una 5090 vera per tutto il resto. Nei sistemi a memoria unificata la regola del doppio non si applica, perché il pool è uno solo; ma è anche l'unico, e non cresce. 6. La terza via: 96 GB a 1,79 TB/s (e le multi-GPU)La RTX PRO 6000 Blackwell è il punto in cui capacità e banda si incontrano: 96 GB di GDDR7 con correzione d'errore, letti alla stessa velocità della 5090, su una scheda a due slot da 600 W (300 nella versione Max-Q, che permette di montarne due o quattro in un tower). Un 70B compresso ci entra con 32.000 token di contesto e gira a 27-32 t/s; gpt-oss-120b ci entra con 30 GB di margine e fa 170-196 t/s; un 27-35B in FP8 serve 20-30 persone di un reparto. È la scheda attorno a cui progettiamo il «server di reparto» nelle configurazioni per l'intelligenza artificiale, con 128-256 GB di RAM di sistema per la regola del doppio. Le alternative vanno messe in fila con onestà:
Un dato di mercato che pesa: con la RTX 5090 a circa il doppio del suo listino e la RTX PRO 6000 rincarata a 16.000 dollari sul marketplace NVIDIA (12 agosto 2026), quattro 5090 costano circa come una PRO 6000, consumano quattro volte tanto e tengono la memoria divisa in quattro pezzi. Il «trucco» delle multi-5090 economiche, nel 2026, si è chiuso da solo. 7. Quale macchina per quale lavoro
8. Gli errori più comuniComprare per il numero più grande della scheda tecnica«128 GB» è il numero che si legge, «273 GB/s» quello che si sente ogni volta che aspetti una risposta. Il primo decide cosa carichi, il secondo quanto lavori. Vanno letti insieme, sempre. Confrontare TOPS, TFLOPS e «petaflop»I 3.352 «AI TOPS» di una 5090, i 126 TOPS di un Ryzen AI Max+ e il «petaflop» dello Spark sono misurati in modi diversi e non si possono confrontare tra loro. Nella generazione, per un utente, il calcolo non è mai il collo di bottiglia; conta nella lettura dei prompt e con molti utenti, dove la GPU dedicata vince comunque. Dimenticare il contesto e la memoria davvero usabileIl modello «entra» solo se entra anche la conversazione: 8-10 GB in più ogni 32.000 token per un 32-70B classico. E su un sistema unificato la GPU non vede tutti i gigabyte della scatola. «Se non entra tutto, vado un po' più piano»No: si va cinque-dieci volte più piano. Il tratto in RAM di sistema o su PCIe detta il passo a tutta la generazione. Meglio un modello che entra tutto, o una scheda più capiente. Credere ai numeri «col turbo»In giro circola il confronto «206 t/s sulla 5090 contro 38 sullo Spark» per Qwen3.8-27B: è vero, ma con lo speculative decoding attivo, una tecnica che moltiplica la velocità di due-quattro volte su codice e formule e molto meno sulla prosa. Senza, lo stesso software dà 85,8 contro 12,3. Il rapporto regge, i valori assoluti no. Peggio ancora i blog che attribuiscono allo Spark 35-45 t/s su un 70B: fisicamente impossibile a 273 GB/s. Fidati solo di chi dichiara modello, formato, contesto e software, e ha una data. Comprare oggi la macchina per il 70B del 2024Il modello da 70 miliardi «denso» era il traguardo di due anni fa. Nel 2026 il lavoro quotidiano lo fanno i 27-35B, che pesano un terzo e vanno due-tre volte più veloci a parità di macchina. Dimensiona sul modello che userai, non su quello che leggevi nei forum l'anno scorso. 9. Le domande che ti fa un esperto prima di consigliarti una macchinaSe hai letto fin qui, sai già che la risposta a «memoria unificata o VRAM?» dipende da poche variabili concrete. Sono le stesse che un nostro esperto ti chiede al telefono, prima ancora di parlare di componenti. Quale modello, con nome e dimensione: è quello che fissa i gigabyte. Quante persone insieme: una o trenta cambiano la scheda, non solo la quantità di memoria. Quanto contesto per ogni domanda: una chat da 4.000 parole o un contratto da 60.000. Che tipo di lavoro: chat, ricerca sui documenti, agenti di programmazione, elaborazioni notturne, immagini. Quali dati non possono uscire dall'azienda, e quindi cosa deve girare in sede per forza. Che orizzonte: cosa succede se tra un anno il modello che ti serve pesa il doppio, e se vuoi poter aggiungere una scheda invece di cambiare scatola. Se hai una risposta per tutte, la macchina si disegna quasi da sola. Se per qualcuna non ce l'hai, è il momento giusto per parlarne. 10. Come lo facciamo in SyspackAbbiamo a catalogo il DGX Spark, i suoi cloni e la DGX Station e assembliamo workstation professionali e server con RTX 5090, RTX PRO 5000 e PRO 6000: non abbiamo interesse a spingerti verso una famiglia o l'altra. Dimensioniamo sul modello, sugli utenti e sul contesto, con i numeri di questo articolo alla mano; costruiamo la macchina con RAM almeno doppia della VRAM, alimentazione e raffreddamento dimensionati per il carico continuo, memoria ECC dove serve; e ti diciamo con chiarezza quando la scatola da 128 GB è la scelta giusta e quando, invece, ti farebbe aspettare ogni risposta. Domande frequentiLa memoria unificata è meglio della VRAM per l'intelligenza artificiale?Dipende dal modello. Se entra nella VRAM, la GPU dedicata è cinque-sette volte più veloce nella generazione e tre-sei volte nella lettura dei prompt. Se non entra (modelli a esperti da oltre 100 miliardi di parametri, o modelli da 200-400 miliardi), la memoria unificata è l'unica scelta sotto i 96 GB di VRAM. Quanti token al secondo fa il DGX Spark?Misurati con llama.cpp e SGLang: 60 t/s su gpt-oss-120b (40 con contesto lungo), 11-12 su un modello denso da 27-32 miliardi, 2,7-4,6 su un Llama 70B. Nella lettura dei prompt, 800-2.000 token al secondo a seconda del modello. Perché una RTX 5090 con 32 GB è più veloce di un sistema da 128 GB?Perché per generare ogni parola il modello viene riletto per intero, e la 5090 legge la sua memoria a 1.792 GB/s contro 273 GB/s dello Spark. La capacità decide se il modello si carica; la banda decide quanto veloce risponde. Quanta memoria serve per gpt-oss-120b?Circa 61 GB per il modello nel suo formato nativo a 4 bit, 68 GB con il contesto al massimo. Entra in una RTX PRO 6000 da 96 GB (170-196 t/s) e nei sistemi da 128 GB unificati (35-70 t/s); su una GPU da 32 GB gira solo spostando gli esperti in RAM di sistema, a 10-28 t/s a seconda della velocità della RAM. Meglio due RTX 5090, una RTX PRO 6000 o due DGX Spark?Per un reparto che usa modelli fino a 120 miliardi di parametri, una PRO 6000: memoria unica da 96 GB, un solo slot, produttività aggregata pari a due 5090 con metà dei consumi. Due 5090 quando serve anche generare immagini e video in parallelo. Due Spark solo per sviluppare e caricare modelli da 235-405 miliardi a un utente.
Continua a leggere: LLM in locale: 6 domande prima di scegliere l'hardware Le misure citate in questo articolo vengono da test indipendenti, indicati nel testo accanto a ogni numero. I prezzi sono listini internazionali alla data indicata e cambiano rapidamente. |