Qwen3.8-2.4T-A95B: el open-weights más grande que existe
Qwen3.8-2.4T-A95B: el open-weights más grande que existe
El 12 de agosto Qwen publicó en Hugging Face Qwen3.8-2.4T-A95B, un Mixture-of-Experts con 2.4 billones de parámetros totales y 95 mil millones activos por inferencia. Es, según los números que circularon por Hacker News, el modelo open-weights más grande publicado hasta hoy por cantidad de parámetros — más grande que Kimi k3 (2.8T en QAT 4-bit pero con 1.5 TB en disco) y con un posicionamiento de benchmarks que pelea mano a mano con Opus 4.8 y GPT-5.6-Sol. La pregunta obvia es: ¿y a mí qué me sirve si quiero correrlo en casa? La respuesta corta es que a casi nadie le sirve en casa — pero la historia de por qué importa igual es la que vale la pena entender, porque redefine qué es "modelo abierto" en 2026.
Si venís siguiendo la cadena de posts sobre IA local que escribí este año — desde Ollama para correr LLMs en tu máquina hasta Swiftlet corriendo un 80B con 4 GB de RAM y Muse Glimmer 30B always-on — ya sabés que la línea entre "corre en tu laptop" y "corre en un cluster" se movió varias veces. Qwen3.8-2.4T-A95B no es un paso más en esa línea: es la confirmación de que la frontera del open-weights vive en data centers, y que el juego local se define con sus hermanos menores.
Los números crudos, sin marketing
El modelo se publica en dos precisiones:
- BF16 lossless: ~4.9 TB de pesos. Necesitás una máquina con ~7 TB de RAM sumando pesos + contexto + KV cache. Estamos hablando de varios nodos con H200 o B200, o racks de Mac Studio de gama alta coordinados por Thunderbolt. No es "homelab", es "presupuesto de startup".
- FP8 cuantizado: ~2.5 TB. Mitad de disco, mismo patrón de hardware.
- Cuantización 1-bit experimental (publicada por la comunidad vía Unsloth): 397 GB con 95B activos. Acá sí entra en hardware al alcance de un equipo mediano con 4x Strix Halo / DGX Spark o similar. Es la métrica que cita la comunidad de LocalLLaMA cuando dice que "esto pone performance de Opus 4.5 en una máquina que una persona normal puede comprar".
Lo importante de la arquitectura MoE: aunque el modelo tiene 2.4T de parámetros totales, solo se activan 95B por token. Esto es lo que lo hace servible. Si fuera denso a 2.4T, hablar de "correrlo localmente" sería ciencia ficción. El truco de MoE es que la memoria que pagás es por la cantidad de expertos cargados, no por la cantidad de expertos que usás en cada paso.
Qué se puede hacer hoy y qué no
Para el 90% de los que leen esto, la respuesta honesta es: nada localmente con este modelo específico, salvo que tengas un cluster hogareño de varios miles de dólares. Lo que sí podés hacer es:
1. Esperar al Qwen3.8-27B denso que sale el viernes. Es la versión que la mayoría de la gente va a terminar corriendo. 27B densos en 4-bit te entra en una Mac con 32 GB de RAM unificada o en una sola RTX 4090, y según la tarjeta de modelo de Qwen hereda mucho del training del grande.
2. Estudiar la arquitectura. El repo viene con un tech report detallado que documenta decisiones de routing, sparsity pattern, y curriculum de entrenamiento. Si estás laburando en agentes o sistemas de inferencia custom, leer el paper vale más que probar el modelo.
3. Usar las versiones destiladas. La comunidad ya está sacando GGUF, AWQ y GPTQ del 27B denso. Como vimos en Swiftlet, cuando hay un modelo denso chiquito que hereda conocimiento de uno grande MoE, la delta de calidad para coding y agentes es marginal.
Regla de oro para IA local en 2026: la escala 2.4T MoE es un techo. Tu techo operativo real está entre 7B y 70B densos, según RAM. Cualquier cosa más grande corre en un endpoint serverless o en un cluster, no en tu Mac.
Lo que la versión open NO tiene (y por qué)
La versión open-weights de Qwen3.8-2.4T-A95B viene con tres recortes respecto a la versión comercial Qwen3.8-Max:
- Sin visión. La entrada multimodal fue removida en el release open. La comunidad ya está hablando de "boltearle" un vision tower tipo Kimi 2.6 o DeepSeek V4 Flash (hay experimentos documentados en r/LocalLLaMA con modelos similares). Funciona, pero la performance cae.
- Contexto capado a 250k tokens en lugar del 1M de la versión Max. Esto se puede extender, pero como pasó con Qwen 3.5 397B (que se mantiene estable hasta ~480k), hay que probar bien antes de confiar.
- Sin soporte out-of-the-box para DSpark / DFlash (decoding speculativo). Sí viene con MTP (Multi-Token Prediction), así que hay boost de throughput vía tensor parallelism, pero no tenés el speedup agresivo de los kernels especulativos nativos.
Es la misma jugada que hizo Meta con Llama, Alibaba con Qwen, y DeepSeek con V3: abrir la arquitectura, no abrir todo el stack. El modelo base está; las optimizaciones de serving quedan pagas.
La licencia, en una línea
La licencia es similar a Kimi k3 con dos caveats que importan:
- Uso libre para investigación, uso interno, o empresas con menos de USD 50M de revenue anual.
- Restricciones arriba de ese umbral si lo usás para servir modelos o para servicios orientados a coding / productivity agents.
Si estás laburando en un side project o en una startup chica, no tenés que preocuparte. Si estás en una empresa mediana construyendo un producto comercial sobre Qwen3.8, leé la licencia antes de meterlo en producción. Es la parte que la mayoría de los tweets sobre el lanzamiento se saltean.
Benchmarks: ¿qué tan bueno es, realmente?
La tarjeta del modelo reporta que Qwen3.8-2.4T-A95B pelea mano a mano con Opus 4.8 y GPT-5.6-Sol, y queda 10-20 puntos debajo de "Fable 5" en la mayoría de los tests. La comunidad en HN fue más escéptica: varios comentarios señalaban que la correlación benchmark→uso real de Qwen fue históricamente irregular. La advertencia honesta es: esperá a测评 independientes (sobre todo en coding agents, que es donde más se nota la diferencia entre "lidera el ranking" y "realmente te resuelve tu ticket") antes de apostar a este modelo sobre alternativas más probadas.
Lectura crítica: la métrica que más importa para agentes no está en los benchmarks estándar. Es "qué tan bien sigue instrucciones multi-step, con tool use real, en un loop largo". Eso se mide en logs de producción, no en tarjetas de HF. Tomá los números como techo, no como piso.
Cómo se conecta con el resto de la conversación sobre IA local
Lo que Qwen3.8-2.4T-A95B confirma es una tendencia que vengo viendo este año: el techo del open-weights se está separando del piso del open-weights. El techo (este modelo, Kimi k3, GLM 5.2) vive en data centers. El piso operativo para devs (Qwen 27B denso, Llama 3.x 70B, DeepSeek V4 Flash, GLM 5.2 destilado) vive en tu Mac o en una sola GPU. Los dos extremos se entrenan juntos, se sirven distinto, y se usan para cosas distintas.
Si laburás en coding agents o sistemas multi-agente, el flujo real es: usar el modelo grande en una API barata (Alibaba Cloud, DeepSeek, Together) para razonamiento pesado, y un modelo denso local para tareas repetitivas o sensibles a privacidad. La promesa de "todo open-weights, todo local" sigue siendo aspiracional para el 99% de los casos reales.
Para los que estén armando un homelab serio con varios miles de dólares para gastar, Swiftlet y Cua en macOS VM ya mostraron que se puede llegar muy lejos con el hardware correcto. La cuantización 1-bit de Qwen3.8 lleva esa línea más lejos: performance de Opus 4.5 en una máquina que efectivamente podrías tener en tu casa, si tu casa es un datacenter pequeño. No es para todos. Pero la opción existe.
Mi take
Qwen3.8-2.4T-A95B no es el modelo que vas a correr mañana. Es la confirmación de que el techo open-weights se está moviendo más rápido que nunca, y de que la distancia entre "research preview" y "producto comercial" se está achicando. La parte que más me importa personally es el Qwen3.8-27B denso que sale el viernes: si hereda bien el training del grande, va a ser el nuevo default para coding agents locales, reemplazando a la generación anterior de 30-40B.
Por ahora, mi recomendación práctica: si te llegó la noticia por HN y estás tentado de bajarlo, no lo hagas — bajá el 27B denso cuando salga. Si querés entender hacia dónde va la industria, leé la tarjeta de modelo y la discusión en Hacker News. La conversación sobre qué significa "abierto" cuando el modelo necesita 7 TB de RAM para correr lossless es más interesante que el modelo en sí.