Qwen3.8 27B + Harness: Il Coding Agent LOCALE Definitivo?
Simone Rizzo • 24.1K views • 2d ago
Description
Entra nella mia Accademia AI:https://www.rizzoaiacademy.com/Vuoi sviluppare soluzioni AI avanzate: https://inferentia.xyz
IG: https://www.instagram.com/simorizzo_ai/
Qwen3.8-27B è uno dei modelli open più interessanti del momento: appena 27 miliardi di parametri, ma performance che in alcuni benchmark riescono a competere — e persino superare — modelli enormemente più grandi.
In questo video vi mostro come eseguire Qwen3.8-27B completamente in locale, partendo da zero.
Vediamo:
• come scaricare i pesi del modello
• quale quantizzazione scegliere
• Ollama, LM Studio, llama.cpp e gli altri model runner
• quanti token/s riesco a ottenere sul mio MacBook Pro
• come aumentare drasticamente la velocità con DFlash2
• come esporre il modello localmente
• come collegarlo a un coding harness
• come usarlo con OpenCode e DeepSeek Harness come vero coding agent locale
Un setup completo per capire fin dove possiamo spingerci oggi con un modello da 27B direttamente sul nostro hardware.
RISORSE:
Qwen3.8-27B – modello ufficiale
https://huggingface.co/Qwen/Qwen3.8-27B
Qwen3.8-27B – Ollama
https://ollama.com/smtek/Qwen3.8-27B:Q2_K_XL
Qwen3.8 – Ollama Library
https://ollama.com/library/qwen3.8
Qwen3.8 – Unsloth
https://unsloth.ai/docs/models/qwen3.8
DFlash2
https://inco.ai/blog/dflash2/
Qwen3.8-27B DFlash2 GGUF
https://huggingface.co/z-lab/Qwen3.8-27B-DFlash2-GGUF
OrcaRouter
https://x.com/OrcaRouter/status/2089385980080148726
Qwen3.8-27B ABLITERATED GGUF
https://huggingface.co/Blackfrost-AI/Qwen3.8-27B-ABLITERATED-GGUF
DeepSeek Harness
https://deepseek.com/harness/en/
00:00 Introduzione e performance del modello da 27B
01:13 Come scaricare il modello tramite LM Studio
02:20 L'importanza della quantizzazione per la RAM
03:44 Scaricare e usare le varianti su Ollama
04:35 Test delle performance in locale
06:57 Configurare la modalità Thinking e Instruct
08:31 Incrementare la velocità con Multiple Token Prediction
12:36 Esplorare le versioni Uncensored del modello
13:52 Come integrare il modello in un Agente AI
15:11 Avviare un server locale API compatibile
17:07 Collegare il modello a Open Code
18:15 Utilizzo del modello con l'Harness di DeepSeek
20:17 Test pratico: Simulazione in codice del sistema solare
21:59 Casi d'uso reali in locale: Privacy e LLM Wiki
24:40 Il futuro dell'Intelligenza Artificiale e dell'hardware
Qwen codingagent intelligenzaartificiale