Qwen 3.8 Flash è un CAPOLAVORO: Questa Architettura Cambia Tutto
Simone Rizzo • 23.3K views • 1d ago
Description
Entra nella mia Accademia AI:https://www.rizzoaiacademy.com/
Vuoi sviluppare soluzioni AI avanzate: https://inferentia.xyz
IG: https://www.instagram.com/simorizzo_ai/
Qwen ha appena presentato Qwen3.8-Flash-Next, e secondo me questo modello è molto più importante di quanto possa sembrare.
Non parliamo soltanto di un nuovo modello open-source estremamente potente: dietro c’è una nuova architettura che anticipa alcune delle idee che vedremo nella prossima generazione di Qwen.
Nel video entriamo nel dettaglio tecnico e, con tanto di lavagna, vediamo una delle novità più interessanti: l'utilizzo degli N-gram e della conditional memory, un approccio che permette di separare parte della memoria statica dalla computazione vera e propria del modello.
L'idea è affascinante: perché utilizzare preziosi layer del Transformer per ricostruire continuamente pattern e informazioni locali che potrebbero essere recuperati direttamente dalla memoria?
È proprio il concetto esplorato anche da DeepSeek con Engram, dove gli N-gram vengono utilizzati per effettuare lookup in memoria in O(1), lasciando maggiore capacità computazionale al modello per reasoning e comprensione del contesto.
Nel video vediamo quindi:
* come funziona la nuova architettura di Qwen3.8-Flash-Next
* perché un modello sparse può competere e superare modelli dense molto più pesanti
* cosa sono realmente gli N-gram
* perché la conditional memory potrebbe diventare un nuovo paradigma negli LLM
* il collegamento con il lavoro di DeepSeek su Engram
* perché questa architettura è interessante in ottica Qwen4
* che hardware possiamo utilizzare per far girare modelli di questo tipo localmente
ARTICOLI E TECHNICAL REPORT
Qwen – Qwen3.8-Flash-Next
https://qwen.ai/blog?id=qwen3.8-flash-next
Unsloth – Qwen3.8 Next
https://unsloth.ai/docs/models/qwen3.8-next
DeepSeek – *Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models*
https://arxiv.org/pdf/2601.07372
Qwen – Technical Report
https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf
🖥️ HARDWARE PER ESEGUIRE IL MODELLO
BOSGAME M5 AI
https://www.bosgamepc.com/products/bosgame-m5-ai-mini-desktop-ryzen-ai-max-395
Xiaomi AI Cube Mini PC
https://www.notebookcheck.net/Xiaomi-unveils-AI-Cube-mini-PC-with-three-Xring-chips-and-150-W-performance.1376717.0.html
00:00 Il nuovo modello Qwen 3.8 Flash
03:13 Performance e benchmark
05:10 Requisiti di memoria e quantizzazione in locale
06:35 La nuova architettura ibrida
08:40 Cos'è l'N-Gram Embedding
11:11 Separazione tra ragionamento (VRAM) e fatti (RAM)
16:17 Analisi tecnica degli N-Gram Embeddings
20:30 Un RAG interno alla rete neurale
24:26 Il miglioramento nel ragionamento logico
27:30 Quale hardware comprare per l'esecuzione in locale?
28:42 Il rivoluzionario mini PC Xiaomi AI Cube
31:49 Notizia dell'ultima ora: rilasciato GLM 5.3 Flash
32:46 Conclusioni: l'AI è una commodity, il futuro è l'hardware
AI Qwen DeepSeek intelligenzaartificiale