DGX Spark o workstation: la macchina giusta per l'AI

Capacità o banda? Guida con i numeri misurati per chi deve scegliere la macchina su cui far girare l'intelligenza artificiale in azienda — aggiornata a settembre 2026


Da quando un modello linguistico si può far girare in ufficio, le domande di chi vuole portare l'intelligenza artificiale in azienda senza mandare i dati fuori sono cambiate. Un anno fa era «quanta VRAM serve?». Oggi sono queste:

«Il DGX Spark ha 128 GB di memoria e la RTX 5090 ne ha 32: perché mi consigliate la scheda?»
«Con 128 GB ci faccio girare tutto?»
«Meglio un modello grande ma lento o uno medio ma veloce?»
«Una 5090 o due?»

Sono domande giuste e hanno tutte la stessa radice: nel confronto tra memoria unificata e VRAM la memoria non è un numero solo, sono due. La capacità (i gigabyte) decide se un modello si carica. La banda (i gigabyte al secondo) decide quanto velocemente risponde. Il modello che vuoi usare, e il lavoro che gli chiedi, decidono quale dei due conta. È per questo che 128 GB non battono sempre 32 GB. E a volte sì.

In questo articolo trovi i numeri misurati da fonti indipendenti (le discussioni ufficiali del progetto llama.cpp, i test di LMSYS, Level1Techs, Hardware Corner e altri, con data) sulle quattro macchine che un professionista o un responsabile IT confronta davvero oggi: RTX 5090, RTX PRO 6000, DGX Spark e i mini-PC con Ryzen AI Max+. Noi abbiamo a catalogo entrambe le famiglie, quella a memoria unificata e quella a GPU dedicata: non abbiamo una scatola da spingere, abbiamo una scelta da farti fare bene.

In breve: quanta memoria serve per un LLM si decide con due domande

Prima domanda: il modello, con il contesto che ti serve, entra in memoria? Se no, conta solo la capacità. La velocità non la guardi nemmeno, perché un modello che non entra o non parte o va cinque-dieci volte più piano.

Seconda domanda: se entra, quanto è veloce quella memoria? Da qui in poi conta solo la banda. Sullo stesso modello, 32 GB letti a 1.792 GB/s generano sei-sette volte più parole al secondo di 128 GB letti a 273 GB/s.

La cosa che cambia tutto nel 2026: i modelli che si usano davvero per lavorare (27-35 miliardi di parametri, 14-20 GB una volta compressi) entrano in 32 GB. Il caso in cui i 128 GB vincono esiste ed è preciso: i modelli «a esperti» da oltre 100 miliardi di parametri, un utente alla volta. E 96 GB veloci battono entrambi.

1. Cos'è la memoria unificata (e cosa non è)


Una workstation tradizionale ha due memorie: la RAM di sistema, che serve al processore, e la VRAM, saldata accanto alla GPU. La VRAM di oggi è GDDR7, costruita per essere letta a più di un terabyte al secondo: su una RTX 5090 o una RTX PRO 6000 sono 1.792 GB/s. Un sistema a memoria unificata ha invece un unico pool condiviso da processore e GPU: è così il DGX Spark di NVIDIA (e i suoi cloni ASUS Ascent GX10, MSI EdgeXpert, Dell, HP, Lenovo), i mini-PC con AMD Ryzen AI Max+ 395 (Framework Desktop, HP Z2 Mini G1a e altri) e, da ottobre 2026, l'RTX Spark N1X per Windows. La memoria è LPDDR5X, la stessa famiglia dei portatili: efficiente, economica per gigabyte, ma molto più lenta della GDDR7. Lo Spark la legge a 273 GB/s, i Ryzen AI Max+ a 256.

Quello che ottieni con la memoria unificata è concreto: tanti gigabyte, un modello da 60-120 GB che si carica intero, una scatola silenziosa che assorbe 120-240 W. Quello che non ottieni va detto con la stessa chiarezza. Primo: 128 GB non sono 128 GB di VRAM. Sistema operativo e processore ne tengono una parte, e sui Ryzen AI Max+ la quota per la GPU va configurata a mano (per default sono 16-32 GB). Secondo: non è espandibile. È saldata, e nel 2026 la LPDDR5X è la memoria più esposta ai rincari: NVIDIA ha alzato il prezzo dello Spark di 700 dollari a febbraio 2026 per la crisi delle memorie di cui abbiamo scritto, e a settembre i sistemi GB10 sono ancora difficili da trovare. Terzo: è un sistema chiuso. La macchina che compri è quella che tieni per tre anni, con i limiti tipici di un prodotto di marca: niente seconda GPU, niente RAM in più.

2. I due numeri che contano: capacità e banda di memoria


Mettiamo in tabella le macchine di cui parliamo, con i dati di targa dichiarati dai produttori a settembre 2026:

MacchinaMemoriaBandaConsumoNota
RTX 509032 GB GDDR71.792 GB/s575 W (scheda)In una workstation, con RAM ed espansioni proprie
RTX PRO 6000 Blackwell96 GB GDDR7 ECC1.792 GB/s600 W (300 W nella versione Max-Q)Stessa banda della 5090, tripla capacità, ECC
RTX PRO 5000 Blackwell48 o 72 GB GDDR7 ECC1.344 GB/s300 WVia di mezzo: un 70B compresso entra nei 72 GB
DGX Spark (GB10) e cloni128 GB LPDDR5X unificata273 GB/s240 W (intero sistema)DGX OS (Linux) con software NVIDIA; dichiarato «fino a 200 miliardi di parametri»
Mini-PC Ryzen AI Max+ 395128 GB LPDDR5X unificata256 GB/s (circa 215 misurati)120-140 WWindows o Linux; senza CUDA, calcolo molto inferiore allo Spark
RAM DDR5 di una workstation64-512 GBcirca 90 GB/s (due canali)—La «strada lenta» su cui finisce ciò che non entra in VRAM

Fonti: schede tecniche NVIDIA e AMD consultate il 7 settembre 2026; banda misurata dei Ryzen AI Max+ da Level1Techs. La banda della 5090 è calcolata dai dati di targa (bus a 512 bit, 28 Gbps).

Perché la banda pesa così tanto? Per generare ogni singola parola, un modello linguistico viene riletto per intero dalla memoria. Quindi la velocità massima con cui ti risponde, per un utente alla volta, è semplicemente banda diviso dimensione del modello. Si misura in token al secondo (t/s): un token è più o meno tre quarti di una parola. Un modello da 27-32 miliardi di parametri compresso a 4 bit occupa circa 18 GB: 1.792 ÷ 18 fa circa 100 t/s su una RTX 5090 (in pratica 60-85, perché nessuna scheda sfrutta il 100% della banda), 273 ÷ 18 fa 15 su un DGX Spark (misurati: 11-12). La potenza di calcolo, i TFLOPS, i «TOPS», il «petaflop» del marketing non compaiono nella formula: in questa fase la GPU aspetta la memoria.

Leggere un documento lungo è un altro lavoro (e qui conta il calcolo)

Prima di rispondere, il modello deve «leggere» tutto quello che gli dai: la domanda, i documenti recuperati dall'archivio aziendale, il codice, la conversazione precedente. I tecnici la chiamano prefill (o prompt processing), e a differenza della generazione dipende dalla potenza di calcolo, perché migliaia di parole vengono elaborate in parallelo. Qui il divario tra GPU dedicata e memoria unificata è ancora più ampio: sullo stesso modello da 120 miliardi di parametri, una RTX PRO 6000 legge 4.500-5.500 token al secondo, lo Spark circa 1.950, un Ryzen AI Max+ tra 340 e 1.000 a seconda del software (misure llama.cpp). Tradotto in attesa: una domanda che porta al modello 12.000 token di documenti aziendali aspetta circa 7 secondi sullo Spark e 35 su un Ryzen AI Max+ (DataHardware, luglio 2026); con un modello da 32 miliardi e 50.000 token di contesto, la nostra stima è di una ventina di secondi su una 5090, oltre un minuto sullo Spark, circa quattro minuti su un Ryzen AI Max+. E lo paghi a ogni domanda.

Il contesto occupa memoria

La «memoria di lavoro» della conversazione (la KV cache) si aggiunge al modello: per un 32B classico sono circa 8 GB ogni 32.000 token di contesto, 32 GB a 128.000; per un 70B, 10 GB a 32.000. I modelli più recenti con architettura ibrida (Qwen3.8-27B, per esempio) ne usano un quarto. Quando ti chiedi se un modello «entra», devi contare anche questo: un 32B compresso da 20 GB con 32.000 token di contesto arriva a 28-29 GB. Entra in una 5090, di misura.

3. Quanti token al secondo servono per lavorare?


Le soglie percepite da chi lavora con questi strumenti tutti i giorni convergono abbastanza:

UsoSotto questa soglia è una sofferenzaDa qui in su si lavora bene
Chat, lettura in tempo reale5 t/s (la velocità di lettura umana)10-20 t/s; oltre 30 non distingui il cloud
Assistente di programmazione20 t/s50-90 t/s, con prima parola entro mezzo secondo
Agenti autonomi (coding agent, flussi a più passaggi)40 t/s80 t/s e oltre: ogni passaggio «ragiona» migliaia di token nascosti
Elaborazioni notturne (estrazione da PDF, traduzioni in serie)qualsiasiconta il totale di pagine all'ora, non la latenza

Due cose che separano chi ha già provato da chi sta valutando. La prima: il tempo di lettura del prompt conta quanto la velocità di scrittura, e i benchmark «a contesto vuoto» non lo mostrano. La seconda: il contesto lungo rallenta tutto. Lo stesso gpt-oss-120b passa da 60 a 40 t/s sullo Spark quando la conversazione arriva a 32.000 token (misure llama.cpp, febbraio 2026).

4. Quando 128 GB battono 32 GB


Il caso è uno: il modello che vuoi non entra in 32 GB. Un Llama 3.3 da 70 miliardi di parametri compresso a 4 bit pesa 42 GB; gpt-oss-120b, il modello aperto di OpenAI da 117 miliardi, ne occupa 61 (68 con il contesto al massimo); Qwen3-235B a 4 bit, 142 GB. Con una scheda da 32 GB questi modelli o non partono o, come vedremo, si trascinano. Con 128 GB partono. Ma «partire» e «lavorare» sono due cose diverse, e la differenza la fa l'architettura del modello.

I modelli «a esperti» (MoE): tanta capacità, poca banda

gpt-oss-120b ha 117 miliardi di parametri, ma per ogni parola ne usa solo 5,1 miliardi: è un modello Mixture of Experts, diviso in 128 «esperti» di cui ne attiva 4 alla volta. Nella formula della velocità, quindi, al denominatore non vanno i 61 GB totali ma i circa 4 GB letti davvero per ogni token. Serve tanta memoria per contenerlo tutto, ma poca banda per farlo girare: è esattamente il profilo dei sistemi a 128 GB unificati, e i numeri lo confermano.

gpt-oss-120b, un utente, llama.cppGenerazioneLettura del promptFonte
RTX 5090 32 GB (esperti spostati in RAM di sistema)9,6 t/s448 t/sHardware Corner, nov. 2025
Mini-PC Ryzen AI Max+ 395, 128 GB34-56 t/s120-340 t/sHardware Corner, guide Strix Halo 2026
DGX Spark, 128 GB60,6 t/s (40,6 con 32.000 token di contesto)1.956 t/sllama.cpp (ggerganov), agg. feb. 2026
RTX PRO 6000, 96 GB170-196 t/s4.500-5.500 t/sllama.cpp (guida gpt-oss), 2025-26

Ecco il caso in cui la memoria unificata è utilizzabile sul serio: un modello da 117 miliardi di parametri a 40-60 token al secondo, in una scatola da 240 W, mentre la 5090 con lo stesso modello arranca a 9,6. Va detto tutto, però: la stessa cosa su 96 GB di GDDR7 va tre volte più veloce nella generazione e due-tre volte nella lettura dei prompt, perché anche i 4 GB attivi per token viaggiano a 1,79 TB/s. I 128 GB lenti vincono sui 32 GB veloci; perdono contro i 96 GB veloci.

Prototipazione, fine-tuning, silenzio

Ci sono poi i motivi per cui consigliamo un DGX Spark anche a chi potrebbe permettersi una GPU dedicata. Lo Spark è un piccolo laboratorio CUDA: monta lo stesso software dei server NVIDIA, permette di sviluppare e fare fine-tuning (NVIDIA lo dichiara fino a 70 miliardi di parametri) su una scrivania, in silenzio; due unità in cluster caricano modelli da 235 miliardi di parametri a un utente (circa 12 t/s misurati). Chi lo ha comprato per chattare velocemente è rimasto deluso; chi lo ha comprato per prototipare quello che poi girerà in datacenter, no.

5. Quando 32 GB battono 128 GB


Tutto quello che entra gira cinque-sette volte più veloce

Prendiamo la classe di modelli che nel 2026 fa il lavoro quotidiano di uno studio o di una PMI: 27-32 miliardi di parametri, 16-20 GB compressi a 4 bit. Entra ovunque. E sullo stesso modello, per un utente alla volta, senza trucchi:

Modello 27-32B a 4 bit, un utenteGenerazioneLettura del promptFonte
RTX 5090 (Qwen3 32B, llama.cpp; Qwen3.8-27B, SGLang)61-86 t/s2.900 t/sHardware Corner nov. 2025; Hugging Face ago. 2026
RTX PRO 6000 (Qwen2.5 32B, llama.cpp)56 t/s2.600 t/sVadi Taslim, mar. 2026
DGX Spark (Qwen3.8-27B, llama.cpp e SGLang)11,6-12,3 t/s840 t/sKubesimplify e ai-muninn, ago. 2026
Mini-PC Ryzen AI Max+ 395 (Qwen3.6/3.8-27B)10-14 t/s100-300 t/sServeTheHome lug. 2026, community

Il rapporto tra 5090 e Spark, a parità di software (SGLang, stesso formato a 4 bit, stesso modello Qwen3.8-27B), è di 85,8 contro 12,3 t/s: sette volte, esattamente il rapporto tra le due bande (1.792 ÷ 273 = 6,6). La fisica torna. Nella lettura dei prompt il rapporto è tre-quattro volte, nel lavoro reale con documenti lunghi la differenza si sente ancora di più.

Il 70B che «entra» nei 128 GB, ma non lavora

È il numero che ha deluso più persone dall'autunno 2025. Un Llama 3.1 70B, il modello «serio» per antonomasia, sul DGX Spark genera 2,7 t/s in formato FP8 e 4,6 t/s compresso a 4 bit (LMSYS, ottobre 2025), su un Ryzen AI Max+ 4,5-5,1 t/s. Sotto la velocità con cui leggi. Lo stesso modello su una RTX PRO 6000 fa 27-32 t/s. La formula lo prevedeva: 273 GB/s diviso 70 GB fa 3,9. È il senso letterale del titolo di questo articolo: i 128 GB fanno entrare il modello grande, ma non lo fanno lavorare.

I modelli che si usano davvero nel 2026 entrano in 32 GB

Qui sta il cambiamento che rende la domanda «grande e lento o medio e veloce?» quasi superata. I modelli aperti con cui si lavora oggi pesano 14-20 GB: Qwen3-Coder-30B-A3B (19 GB), gpt-oss-20b (14), Qwen3.8-27B (16), Gemma 4 31B (circa 18), Devstral Small 2 da 24 miliardi (14). E secondo le schede tecniche dei rispettivi produttori superano nettamente il 70B di fine 2024: sul test di ragionamento scientifico GPQA Diamond, Llama 3.3 70B si fermava a 50,5 punti, mentre Gemma 4 31B fa 84,3, Qwen3.6-35B-A3B 86,0 e Qwen3.8-27B 89,2; sulla programmazione (SWE-bench Verified) Devstral Small 2 fa 68,0 e Qwen3.6-35B-A3B 73,4. Sono punteggi dichiarati dai produttori e non replicati da terzi, da leggere come ordine di grandezza; ma i divari sono troppo ampi per essere un effetto del metodo di misura.

Un modello da 16 GB fa oggi cose che un anno fa richiedevano 80-140 GB. Il modello quotidiano di uno studio o di un ufficio tecnico nel 2026 entra in 32 GB e ci gira a 60-90 token al secondo. Il 70B «denso» resta la scelta giusta solo per chi ha bisogno della sua conoscenza enciclopedica, e in quel caso serve una memoria insieme capiente e veloce (sezione 6).

Più utenti, contesti lunghi, immagini

Se il modello serve a un reparto e non a una persona, la GPU dedicata allunga ancora. I motori server (vLLM, SGLang) leggono i pesi una volta sola per tutti gli utenti in coda e moltiplicano la produttività complessiva, ma serve potenza di calcolo, che una GPU Blackwell ha in abbondanza e un sistema unificato no. Con Llama 70B in FP8 e otto utenti insieme, una RTX PRO 6000 produce 153 t/s complessivi contro 20 dello Spark (LMSYS). Una RTX 5090 con vLLM serve oltre 30 persone in chat su un modello da 8 miliardi, o 6 su un 34B, con la prima parola sotto il mezzo secondo (GigaGPU, aprile 2026); una RTX PRO 6000 serve 50 richieste simultanee su un 32B a 17-19 t/s ciascuna (DatabaseMart, agosto 2026). E se la stessa macchina deve anche generare immagini o video, il discorso è chiuso in partenza: ne abbiamo scritto in VRAM per ComfyUI: come dimensionare la workstation, e perfino chi ha provato lo Spark per la generazione video (Hardware Upgrade, giugno 2026) nota che ogni operazione è più lenta che su una scheda grafica tradizionale.

Il precipizio dei 32 GB (e il trucco della RAM doppia)

Cosa succede se il modello sta in VRAM «quasi tutto»? Non va un po' più piano: crolla. Un 32B compresso con 6 GB fuori dalla VRAM dimezza la velocità (da circa 45 a circa 20 t/s); gpt-oss-120b su una 5090 con la suddivisione automatica dei layer fa 3,4 t/s. La ragione è nella tabella della sezione 2: la strada su cui finisce ciò che non entra, la RAM DDR5 a 90 GB/s o il bus PCIe a 63, è venti-trenta volte più lenta della GDDR7, e siccome ogni parola richiede tutti i pesi, il tratto lento detta il passo. Un modello un po' più piccolo che entra tutto è quasi sempre la scelta migliore di uno più grande che deborda.

Da qui la regola che applichiamo a ogni workstation per l'AI: RAM di sistema almeno doppia rispetto alla VRAM, veloce e a due canali pieni. Serve a caricare i modelli, a tenere il contesto e, con i modelli a esperti, a fare qualcosa di più: tenere in VRAM la parte letta a ogni parola e lasciare gli esperti in RAM. Un test documentato su gpt-oss-120b con una scheda da soli 12 GB e 64 GB di DDR5 dà 25-28 t/s con la memoria a 6000 MT/s e 10-11 con la stessa memoria lasciata a 2000 (carteakey.dev, 2025-26): il triplo, solo attivando il profilo XMP. Una workstation con RTX 5090 e 96-192 GB di DDR5 veloce è l'alternativa PC ai box da 128 GB per i modelli a esperti: generazione nella stessa classe, lettura dei prompt molto più rapida, e resta una 5090 vera per tutto il resto. Nei sistemi a memoria unificata la regola del doppio non si applica, perché il pool è uno solo; ma è anche l'unico, e non cresce.

6. La terza via: 96 GB a 1,79 TB/s (e le multi-GPU)


La RTX PRO 6000 Blackwell è il punto in cui capacità e banda si incontrano: 96 GB di GDDR7 con correzione d'errore, letti alla stessa velocità della 5090, su una scheda a due slot da 600 W (300 nella versione Max-Q, che permette di montarne due o quattro in un tower). Un 70B compresso ci entra con 32.000 token di contesto e gira a 27-32 t/s; gpt-oss-120b ci entra con 30 GB di margine e fa 170-196 t/s; un 27-35B in FP8 serve 20-30 persone di un reparto. È la scheda attorno a cui progettiamo il «server di reparto» nelle configurazioni per l'intelligenza artificiale, con 128-256 GB di RAM di sistema per la regola del doppio. Le alternative vanno messe in fila con onestà:

ConfigurazioneMemoriaCosa fa beneDove si ferma
1 RTX 509032 GB a 1.792 GB/sModelli 27-35B a 60-90 t/s, da 1 a 10 utenti, immagini e videoIl 70B non entra; contesti da 128.000 token no
2 RTX 509064 GB (32+32), senza NVLink70B a 4 bit diviso su due schede a circa 28 t/s; produttività aggregata pari a una PRO 60001.150 W, alimentatore e case dedicati, memoria divisa in due: gpt-oss-120b (63 GB) non ci sta
1 RTX PRO 600096 GB a 1.792 GB/s, ECC70B a 27-32 t/s, 120B MoE a 170-196, 20-30 utenti, fine-tuning fino a 70B su una schedaIl prezzo: NVIDIA lo ha alzato del 20% ad agosto 2026 (quasi raddoppiato dal lancio del 2025)
2 DGX Spark in cluster256 GB a 273 GB/s ciascunoModelli da 235-405 miliardi a un utente, sviluppo su stack NVIDIA, 480 W in tuttoCirca 12 t/s sul 235B; lettura dei prompt e multiutenza

Un dato di mercato che pesa: con la RTX 5090 a circa il doppio del suo listino e la RTX PRO 6000 rincarata a 16.000 dollari sul marketplace NVIDIA (12 agosto 2026), quattro 5090 costano circa come una PRO 6000, consumano quattro volte tanto e tengono la memoria divisa in quattro pezzi. Il «trucco» delle multi-5090 economiche, nel 2026, si è chiuso da solo.

7. Quale macchina per quale lavoro


Cosa devi fareModello sensato (2026)Memoria che serveMacchinaPerché
Assistente sui documenti interni, una persona8-14B, fino a un 27B16-24 GB di VRAMWorkstation con RTX 5090 (o RTX PRO 4500)Conta la lettura dei documenti, non la taglia del modello
Assistente documenti e supporto per 10-30 dipendenti27-35B in FP8, o gpt-oss-120b96 GB di VRAMServer con RTX PRO 6000Serve calcolo per il batching e memoria per le conversazioni di tutti
Assistente e agenti di programmazione, 1-2 sviluppatoriDevstral Small 2, Qwen3.8-27B, Qwen3-Coder-Next32 GB (48-64 per Coder-Next)RTX 5090; PRO 6000 per contesti oltre 200.000 tokenLa latenza sui prompt lunghi decide se l'agente è usabile
Estrazione dati da PDF, contratti, fatture in serie8-14B, 27B per le clausole; modelli visivi 4-8B24-32 GBRTX 5090 o PRO 6000, elaborazione notturnaConta il totale all'ora; la memoria unificata è la scelta meno adatta
Traduzioni, verbali di riunione, FAQ8-14B (27B per la qualità)16-32 GBRTX 5090 o RTX PRO 4500; basta anche un DGX SparkCompiti ormai facili: qui anche la memoria unificata basta
Modelli a esperti da 100-200B per una persona, sviluppo e prototipazionegpt-oss-120b, Qwen3-Coder-Next128 GB unificati o 96 GB di VRAMDGX Spark; PRO 6000 se serve velocitàIl caso in cui la memoria unificata è una scelta sensata
Ricerca su modelli da 200-400B, fine-tuningQwen3-235B, DeepSeek V4 Flash; LoRA su 8-30B192-384 GB di VRAM, o 256 GB unificati2-4 RTX PRO 6000; due DGX Spark in cluster per la sola inferenza a un utenteSolo qui i 256 GB unificati «vincono»: il modello altrimenti non si carica

8. Gli errori più comuni


Comprare per il numero più grande della scheda tecnica

«128 GB» è il numero che si legge, «273 GB/s» quello che si sente ogni volta che aspetti una risposta. Il primo decide cosa carichi, il secondo quanto lavori. Vanno letti insieme, sempre.

Confrontare TOPS, TFLOPS e «petaflop»

I 3.352 «AI TOPS» di una 5090, i 126 TOPS di un Ryzen AI Max+ e il «petaflop» dello Spark sono misurati in modi diversi e non si possono confrontare tra loro. Nella generazione, per un utente, il calcolo non è mai il collo di bottiglia; conta nella lettura dei prompt e con molti utenti, dove la GPU dedicata vince comunque.

Dimenticare il contesto e la memoria davvero usabile

Il modello «entra» solo se entra anche la conversazione: 8-10 GB in più ogni 32.000 token per un 32-70B classico. E su un sistema unificato la GPU non vede tutti i gigabyte della scatola.

«Se non entra tutto, vado un po' più piano»

No: si va cinque-dieci volte più piano. Il tratto in RAM di sistema o su PCIe detta il passo a tutta la generazione. Meglio un modello che entra tutto, o una scheda più capiente.

Credere ai numeri «col turbo»

In giro circola il confronto «206 t/s sulla 5090 contro 38 sullo Spark» per Qwen3.8-27B: è vero, ma con lo speculative decoding attivo, una tecnica che moltiplica la velocità di due-quattro volte su codice e formule e molto meno sulla prosa. Senza, lo stesso software dà 85,8 contro 12,3. Il rapporto regge, i valori assoluti no. Peggio ancora i blog che attribuiscono allo Spark 35-45 t/s su un 70B: fisicamente impossibile a 273 GB/s. Fidati solo di chi dichiara modello, formato, contesto e software, e ha una data.

Comprare oggi la macchina per il 70B del 2024

Il modello da 70 miliardi «denso» era il traguardo di due anni fa. Nel 2026 il lavoro quotidiano lo fanno i 27-35B, che pesano un terzo e vanno due-tre volte più veloci a parità di macchina. Dimensiona sul modello che userai, non su quello che leggevi nei forum l'anno scorso.

9. Le domande che ti fa un esperto prima di consigliarti una macchina


Se hai letto fin qui, sai già che la risposta a «memoria unificata o VRAM?» dipende da poche variabili concrete. Sono le stesse che un nostro esperto ti chiede al telefono, prima ancora di parlare di componenti. Quale modello, con nome e dimensione: è quello che fissa i gigabyte. Quante persone insieme: una o trenta cambiano la scheda, non solo la quantità di memoria. Quanto contesto per ogni domanda: una chat da 4.000 parole o un contratto da 60.000. Che tipo di lavoro: chat, ricerca sui documenti, agenti di programmazione, elaborazioni notturne, immagini. Quali dati non possono uscire dall'azienda, e quindi cosa deve girare in sede per forza. Che orizzonte: cosa succede se tra un anno il modello che ti serve pesa il doppio, e se vuoi poter aggiungere una scheda invece di cambiare scatola. Se hai una risposta per tutte, la macchina si disegna quasi da sola. Se per qualcuna non ce l'hai, è il momento giusto per parlarne.

10. Come lo facciamo in Syspack


Abbiamo a catalogo il DGX Spark, i suoi cloni e la DGX Station e assembliamo workstation professionali e server con RTX 5090, RTX PRO 5000 e PRO 6000: non abbiamo interesse a spingerti verso una famiglia o l'altra. Dimensioniamo sul modello, sugli utenti e sul contesto, con i numeri di questo articolo alla mano; costruiamo la macchina con RAM almeno doppia della VRAM, alimentazione e raffreddamento dimensionati per il carico continuo, memoria ECC dove serve; e ti diciamo con chiarezza quando la scatola da 128 GB è la scelta giusta e quando, invece, ti farebbe aspettare ogni risposta.

Domande frequenti


La memoria unificata è meglio della VRAM per l'intelligenza artificiale?

Dipende dal modello. Se entra nella VRAM, la GPU dedicata è cinque-sette volte più veloce nella generazione e tre-sei volte nella lettura dei prompt. Se non entra (modelli a esperti da oltre 100 miliardi di parametri, o modelli da 200-400 miliardi), la memoria unificata è l'unica scelta sotto i 96 GB di VRAM.

Quanti token al secondo fa il DGX Spark?

Misurati con llama.cpp e SGLang: 60 t/s su gpt-oss-120b (40 con contesto lungo), 11-12 su un modello denso da 27-32 miliardi, 2,7-4,6 su un Llama 70B. Nella lettura dei prompt, 800-2.000 token al secondo a seconda del modello.

Perché una RTX 5090 con 32 GB è più veloce di un sistema da 128 GB?

Perché per generare ogni parola il modello viene riletto per intero, e la 5090 legge la sua memoria a 1.792 GB/s contro 273 GB/s dello Spark. La capacità decide se il modello si carica; la banda decide quanto veloce risponde.

Quanta memoria serve per gpt-oss-120b?

Circa 61 GB per il modello nel suo formato nativo a 4 bit, 68 GB con il contesto al massimo. Entra in una RTX PRO 6000 da 96 GB (170-196 t/s) e nei sistemi da 128 GB unificati (35-70 t/s); su una GPU da 32 GB gira solo spostando gli esperti in RAM di sistema, a 10-28 t/s a seconda della velocità della RAM.

Meglio due RTX 5090, una RTX PRO 6000 o due DGX Spark?

Per un reparto che usa modelli fino a 120 miliardi di parametri, una PRO 6000: memoria unica da 96 GB, un solo slot, produttività aggregata pari a due 5090 con metà dei consumi. Due 5090 quando serve anche generare immagini e video in parallelo. Due Spark solo per sviluppare e caricare modelli da 235-405 miliardi a un utente.

Vuoi far girare un modello linguistico in azienda e non sai se ti serve capacità o banda?

Raccontaci quale modello vuoi usare, quante persone lo useranno e su quali documenti. Un nostro esperto ti dice quali numeri aspettarti su ciascuna macchina, con le fonti, e progetta la workstation o il server giusto per il tuo lavoro. Senza impegno e senza pressioni.

Parla con un esperto

Continua a leggere: LLM in locale: 6 domande prima di scegliere l'hardware

Le misure citate in questo articolo vengono da test indipendenti, indicati nel testo accanto a ogni numero. I prezzi sono listini internazionali alla data indicata e cambiano rapidamente.

Scorri