Qwen 3.8 en Local: Cuanta VRAM Necesitas de Verdad [2026]
💡 Transparencia: este articulo contiene enlaces de afiliado de Amazon. Si compras a traves de ellos, Javadex recibe una pequena comision sin coste adicional para ti. Los precios estan verificados en amazon.es el 17 de agosto de 2026.
En Resumen
- Alibaba libero los pesos de Qwen 3.8 bajo licencia Apache 2.0 el 12 de agosto de 2026. Son dos modelos: el Qwen3.8-27B, denso y multimodal, y el Qwen3.8-Max de 2,4 billones de parametros totales con 95.000 millones activos.
- En local solo te interesa el 27B. El Max es el primer modelo de esa gama con pesos abiertos, y es un hito, pero no entra en ninguna maquina de casa.
- La cifra que decide: el 27B en Q4_K_M ocupa unos 16,4 GB de VRAM solo para los pesos. Una tarjeta de 16 GB no llega, porque encima hay que meter el KV cache.
- El KV cache cuesta unos 2,1 GB por cada 32.000 tokens de contexto. Con los 262.000 tokens nativos del modelo se va a unos 17 GB, mas que el propio modelo cuantizado.
- Regla practica: 24 GB de VRAM para Q4_K_M con contexto util, 16 GB solo si bajas a Q3_K_M asumiendo perdida de calidad, y 12 GB solo para probarlo.
Que es Qwen 3.8 y por que importa en local
El 12 de agosto de 2026, el equipo de Qwen publico los pesos de su nueva generacion bajo Apache 2.0, que es la licencia permisiva de verdad: puedes usarlo comercialmente, modificarlo y redistribuirlo sin pedir permiso ni pagar nada.
Salieron dos modelos y conviene no confundirlos:
| Modelo | Parametros | Tipo | Contexto | ¿En local? |
|---|---|---|---|---|
| Qwen3.8-27B | 27.000 millones, densos | Multimodal | 262.000 tokens (1 M con YaRN) | Si |
| Qwen3.8-Max | 2,4 billones totales / 95.000 millones activos | MoE | — | No |
El Max es la noticia de titular: es el primer modelo de gama Max que Alibaba libera con pesos abiertos, y eso rompe la norma de que los modelos frontera se quedan cerrados. Para ti y para mi, sin embargo, es irrelevante: ni siquiera cuantizado agresivamente entra en hardware de consumo.
El 27B es el que cambia algo en tu escritorio. Es denso (no MoE, asi que todos los parametros se activan siempre), multimodal (procesa imagenes y video, no solo texto) y, segun el propio anuncio, supera al mayor Qwen3.7-Plus en tareas de codigo y de ofimatica. Un modelo de 27B que rinde por encima de la generacion anterior mas grande es exactamente el tipo de salto que hace util la IA local.
Cuanta VRAM necesita Qwen 3.8 27B, cuantizacion por cuantizacion
Aqui esta el nucleo del articulo. Los pesos ocupan lo siguiente:
| Cuantizacion | VRAM (solo pesos) | Calidad | Tarjeta minima realista |
|---|---|---|---|
| Q3_K_M / IQ3 | ~13 GB | Bajada perceptible | 16 GB |
| Q4_K_M | ~16,4 GB | El estandar | 24 GB |
| Q5_K_M / Q6_K | ~21 GB | Casi sin perdida | 24 GB muy justo |
| Q8_0 | ~27-30 GB | Sin perdida practica | 48 GB |
| FP16 | ~61 GB | Referencia | 80 GB |
Y ahora la parte que casi nadie cuenta y que hace que la gente compre mal:
El KV cache cuesta unos 2,1 GB por cada 32.000 tokens de contexto. Los 262.000 tokens nativos del modelo suponen unos 17 GB adicionales, mas que el propio modelo en Q4.
Traducido a decisiones de compra:
- Tarjeta de 24 GB con Q4_K_M: los pesos ocupan 16,4 GB y te quedan unos 7,6 GB para el cache, que dan aproximadamente 56.000 tokens de contexto. Es el punto dulce y es lo que yo recomendaria.
- Tarjeta de 16 GB con Q4_K_M: los pesos solos ya son 16,4 GB. No cabe. Ollama te lo repartira entre VRAM y RAM del sistema, y el rendimiento se desploma.
- Tarjeta de 16 GB con Q3_K_M: 13 GB de pesos y unos 3 GB de margen, es decir, unos 45.000 tokens. Funciona, con una perdida de calidad que se nota sobre todo en razonamiento largo y codigo.
- Tarjeta de 12 GB: solo Q3 y con contexto corto. Sirve para probar el modelo, no para trabajar con el.
El error clasico es mirar el tamano del fichero GGUF, ver 16,4 GB, tener una tarjeta de 16 GB y dar por hecho que entra. No entra. Al fichero hay que sumarle el cache, y el cache crece con lo que le pidas.
Que hardware comprar para Qwen 3.8 27B
Este modelo cae justo en el escalon incomodo del mercado: pide mas de 16 GB y menos de 32 GB. Hay tres caminos y ninguno es barato.
Camino 1 — VRAM dedicada de 24 GB
Es el que da mejor rendimiento por euro en velocidad. Una tarjeta de 24 GB mueve el 27B en Q4_K_M con contexto util y a buena velocidad. El problema es que las tarjetas nuevas de 24 GB de consumo estan caras, y la opcion realista sigue siendo el mercado de segunda mano, con lo que eso implica de garantia inexistente.
Camino 2 — 16 GB dedicados y aceptar Q3
Si ya tienes o vas a comprar una tarjeta de 16 GB, Qwen 3.8 27B te va a funcionar en Q3_K_M. La forma mas barata de tener 16 GB en agosto de 2026 es la RTX 5060 Ti de 16 GB a 679,99 EUR; si generas mucho texto de forma continua, la RTX 5070 Ti de 16 GB a 1.099,99 EUR tiene la misma capacidad con el doble de ancho de banda, lo que se traduce en aproximadamente el doble de tokens por segundo.
Sinceramente: si tu unico objetivo es este modelo concreto, plantéate si no te sirve mejor Qwen 3.8 en un tamano menor o la generacion anterior en Q4, que suele dar mejor resultado que este 27B estrangulado en Q3.
Camino 3 — Memoria unificada, que es donde este modelo brilla
Aqui es donde el 27B se pone facil. En un equipo con memoria unificada, la GPU accede a la memoria del sistema sin copiar, asi que 64 GB unificados te dan margen de sobra para Q8 y para contexto largo, que es la gracia real de este modelo.
| Equipo | Precio | Memoria | Que te permite con Qwen 3.8 27B |
|---|---|---|---|
| Mac Mini M4 | 719,00 EUR | 16 GB unificada | Q3 con contexto corto |
| Beelink SER10 Max | 1.669,00 EUR | 64 GB | Q4 o Q5 con contexto amplio |
| GMKtec EVO-X2 | 2.079,96 EUR | 64 GB unificada | Q8 y contexto largo de verdad |
Precios verificados el 17 de agosto de 2026. La contrapartida de la memoria unificada es la velocidad: genera menos tokens por segundo que una GPU dedicada equivalente. A cambio, ejecuta lo que la GPU dedicada ni siquiera puede cargar.
Si estas decidiendo hardware desde cero, el contexto completo esta en que torre montar para IA local en 2026 y en el ranking de mini PC para IA local.
Como ejecutar Qwen 3.8 en local con Ollama
Los pesos estan en Hugging Face y en ModelScope, y hay cuantizaciones GGUF publicadas por la comunidad ademas de las oficiales.
1# Instalar Ollama si aun no lo tienes2curl -fsSL https://ollama.com/install.sh | sh3 4# Comprobar cuanta VRAM ve Ollama antes de descargar 16 GB5ollama ps6nvidia-smi --query-gpu=memory.total,memory.free --format=csv7 8# Limitar el contexto para que quepa (esto es lo que se olvida)9OLLAMA_CONTEXT_LENGTH=32768 ollama serve
Tres avisos practicos antes de que descargues 16 GB:
- Fija el contexto tu mismo. Si dejas que el modelo use su ventana nativa de 262.000 tokens, el KV cache se come 17 GB y te tira a RAM del sistema aunque el modelo cupiera. Empieza en 32.768 y sube si te sobra memoria.
- Busca las etiquetas con sufijo de VRAM. En Ollama circulan variantes preparadas para presupuestos de 12 y 16 GB, con la cuantizacion y el contexto ya ajustados. Ahorran mucho ensayo y error.
- Comprueba que es multimodal antes de darle imagenes. No todas las cuantizaciones de la comunidad conservan la parte de vision.
El paso a paso general de Ollama, si vas empezando, lo tengo en la guia completa de Ollama.
¿Merece la pena frente a lo que ya tienes?
Depende de con que compares, y aqui conviene ser honesto:
- Si vienes de un 7B-8B: el salto es grande, sobre todo en codigo y en tareas de varios pasos. Pero solo si puedes ejecutarlo en Q4 o mejor. Un 27B en Q3 estrangulado por falta de contexto puede rendirte peor que un 8B comodo.
- Si vienes de la generacion anterior de 32B: el 27B es mas pequeno y, segun Alibaba, mejor en codigo y ofimatica. Ahorras VRAM y ganas contexto.
- Si lo que buscas es multimodal en local: ahi si hay poca competencia. Un modelo de pesos abiertos que procesa documentos y video con 262.000 tokens de contexto y licencia Apache 2.0 no es facil de igualar.
Y una advertencia sobre las cifras: los benchmarks que circulan estos dias vienen del anuncio del propio fabricante. Como siempre con un modelo recien salido, la comparacion util es la tuya, con tus documentos y tus tareas. Las mias con este modelo llevan pocos dias y no voy a publicar numeros de rendimiento que no haya medido bien.
Preguntas Frecuentes
¿Cuanta VRAM necesita Qwen 3.8 27B?
Unos 16,4 GB solo para los pesos en Q4_K_M, mas el KV cache, que cuesta aproximadamente 2,1 GB por cada 32.000 tokens de contexto. En la practica hacen falta 24 GB para usarlo comodo en Q4, o 16 GB bajando a Q3_K_M y aceptando perdida de calidad.
¿Puedo ejecutar Qwen 3.8 en una tarjeta de 16 GB?
En Q4_K_M no, porque los pesos solos ya ocupan 16,4 GB y no queda sitio para el cache. En Q3_K_M si: unos 13 GB de pesos dejan margen para unos 45.000 tokens de contexto. La RTX 5060 Ti de 16 GB a 679,99 EUR es la forma mas barata de tener esos 16 GB.
¿Que es Qwen 3.8 Max y puedo usarlo en local?
Es el modelo grande de la familia, con 2,4 billones de parametros totales y 95.000 millones activos, y es el primero de gama Max que Alibaba libera con pesos abiertos. No es ejecutable en hardware de consumo ni cuantizado agresivamente. Para local, el modelo es el 27B.
¿Que licencia tiene Qwen 3.8?
Apache 2.0, que permite uso comercial, modificacion y redistribucion sin pagar ni pedir permiso. Es una de las razones por las que este lanzamiento importa mas que sus benchmarks.
¿Cuanto contexto admite Qwen 3.8?
262.000 tokens de forma nativa, y hasta un millon aplicando YaRN. Ojo: usar esa ventana completa cuesta unos 17 GB de KV cache, mas que el propio modelo cuantizado en Q4. En local casi siempre querras fijar un contexto mucho menor.
¿Es mejor Qwen 3.8 27B que Qwen 3.6 en local?
Segun el anuncio de Alibaba, el 27B supera al mayor Qwen3.7-Plus en codigo y ofimatica, asi que sobre el papel si. En la practica depende de si tu hardware te deja ejecutarlo en Q4 o mejor: un modelo mas capaz mal cuantizado y sin contexto rinde peor que uno menor bien alojado.
¿Necesito GPU NVIDIA para ejecutar Qwen 3.8?
No. Funciona en memoria unificada (Apple Silicon o AMD Ryzen AI Max+), y ahi es donde el 27B resulta mas comodo, porque la limitacion deja de ser la capacidad. A cambio genera menos tokens por segundo que una GPU dedicada equivalente.
Mi Recomendacion Personal
Qwen 3.8 27B es el modelo que hace que merezca la pena replantearse el hardware, y a la vez el que mejor demuestra que el numero que importa no es el del modelo, es el del KV cache.
- Si ya tienes 24 GB de VRAM: descargalo en Q4_K_M, fija el contexto en 32.768 y disfrutalo. Es el mejor sitio donde estar.
- Si tienes o vas a comprar 16 GB: la RTX 5060 Ti de 16 GB a 679,99 EUR te lo mueve en Q3. Funciona, pero no es donde este modelo se luce.
- Si lo que quieres es contexto largo y multimodal de verdad: memoria unificada, y ahi el GMKtec EVO-X2 de 64 GB a 2.079,96 EUR es el que te deja usar Q8 sin pelearte con la memoria.
- Si tienes 8 GB: no es tu modelo, y no pasa nada. Un modelo de 8B bien alojado te dara mejor experiencia que este a trompicones.
Lo que no haria: descargar 16 GB de pesos antes de comprobar con nvidia-smi cuanta VRAM libre tienes de verdad. Es media hora de descarga para descubrir que no cabe.
Fuentes
- Alibaba's Qwen team releases Qwen 3.8 models with open weights under the Apache 2.0 license — The Decoder
- Qwen 3.8 27B VRAM Requirements — desglose por cuantizacion
- How to Run Qwen 3.8 27B Locally: Ollama, GGUF, and Single-GPU Setup — Yotta Labs
- Qwen3.8 - How to Run Locally — Unsloth
Recursos y Guias Relacionadas
- Mejores modelos de Ollama: ranking completo — donde encaja Qwen 3.8 frente al resto
- Guia completa de Ollama — desde la instalacion
- Que torre montar para IA local — el hardware, con precios de agosto de 2026
- Cuanta RAM necesito para IA local — el calculo general por modelo
- Mejores mini PC para IA local — equipos con memoria unificada

