Mac Studio M5 Ultra: LLMs frontier corriendo en tu escritorio
Mac Studio M5 Ultra: LLMs frontier corriendo en tu escritorio
Si venís siguiendo esta serie sobre IA local — desde Ollama para correr LLMs en tu máquina hasta Swiftlet corriendo un 80B con 4 GB de RAM, Muse Glimmer como agente always-on y el truco de Cua para destrabar Metal en VMs — ya sabés que la línea entre "corre en tu laptop" y "corre en un cluster" se movió varias veces. Hoy Apple la mueve otra vez, y esta vez con un argumento difícil de ignorar: el Mac Studio con M5 Ultra es, sobre el papel, el primer escritorio de consumo que promete correr modelos frontier en serio sin necesidad de un rack de GPUs. Y cuando digo frontier, digo un 70B denso, o un MoE de medio billón de parámetros, con un context window útil. Te lo desgrano.
Qué hay de nuevo en el M5 Ultra
Lo que hizo Apple esta vez no es una iteración más de la línea Ultra: es un cambio de arquitectura. El M5 Ultra es el primer SoC de Apple con arquitectura quad-die. En lugar de pegar dos dies como hacía el M3 Ultra, ahora son cuatro dies unidos por la nueva generación de UltraFusion, que según el press release sube el inter-die bandwidth a más de 4.4 TB/s y multiplica por 6 la densidad de conexión. Para nosotros, los que corremos inferencia, eso significa que la memoria unificada se comporta como un solo pool de hasta 192 GB accesible por cualquier unidad de cómputo del chip.
Los números que importan para IA:
- CPU: hasta 36 núcleos (12 super + 24 performance). 1.25× single-thread vs M3 Ultra, 1.3× multi-thread.
- GPU: hasta 80 núcleos, cada uno con Neural Accelerator dedicado. Apple habla de 4.5× peak GPU compute para AI vs M3 Ultra.
- Unified memory bandwidth: 1.2 TB/s, 50% más que el M3 Ultra y casi el triple que el M2 Ultra.
- Neural Engine dual de 16 núcleos: 2× peak compute vs generación anterior, accesible simultáneamente desde los frameworks del sistema.
El dato que más veces vas a leer en los próximos días es el del bandwidth. 1.2 TB/s no es un número de marketing: es la métrica que define el tamaño de modelo que podés correr. Para un LLM denso en cuantización 4-bit, la regla de oro es que necesitás aproximadamente 0.5 GB por cada mil millones de parámetros en memoria, y bandwidth suficiente para mover esa memoria varias veces por segundo. Con 192 GB unificables, entrás cómodos con un Qwen3-Next-80B en 4-bit, un Llama 70B cuantizado, o un MoE de 200-300B con 8B activos (como los Kimi k2 quantized que están apareciendo). Y con 1.2 TB/s de bandwidth, la diferencia entre cargar el modelo una vez y re-cargar KV cache se vuelve marginal.
Por qué importa si te interesa la IA local
En la cadena de posts que llevo escritos sobre el tema, hay un patrón que se repite: el cuello de botella real para correr modelos grandes en casa no es el cómputo, es la memoria. Un M3 Max con 128 GB unificados ya podía correr un Llama 70B cuantizado, pero la inferencia era penosa porque el bandwidth de 800 GB/s se quedaba corto en context windows largos. Cuando la velocidad caía a 3-4 tokens/segundo, el modelo dejaba de ser usable para un agente que necesita respuesta sub-segundo.
El M5 Ultra ataca exactamente ese punto. Con 1.2 TB/s y la arquitectura quad-die, el press release habla de correr modelos frontier on device como caso de uso explícito, no como nota al pie. Es la primera vez que Apple pone "running compute-intensive frontier AI models on device" en la descripción de un producto, y la elección de palabras no es inocente: es la promesa de que un escritorio, no un cluster, puede correr el próximo Claude Opus o GPT-5.6 sin pedir disculpas por la latencia.
Lo que cambia en la práctica Pasar de 800 GB/s a 1.2 TB/s de bandwidth no suena como mucho en porcentaje, pero el sistema de memoria del M5 Ultra es el doble de ancho por unidad de cómputo que el M2 Ultra de hace dos años. En inferencia, eso se traduce en context windows más largos sin que colapse el throughput.
Qué se puede correr (con números honestos)
Hay que ser realista: con 192 GB unificados y 1.2 TB/s no vas a correr un modelo de 500B en precisión completa, ni falta que hace. Lo que sí podés correr, y que antes necesitabas un cluster:
- Llama 4 70B en 4-bit (~40 GB): te entran dos copias en memoria, lo que sirve para speculative decoding o A/B testing de prompts. Throughput esperado, según benchmarks tempranos de la comunidad, en el orden de 25-35 tokens/segundo en generación.
- Qwen3-Next-80B-A3B en 4-bit (~45 GB, MoE con 3B activos): entra con margen para KV cache de context windows de 64k. En benchmarks preliminares de ModelScope, se acerca a Opus 4.8 en razonamiento y corre a 40+ tokens/segundo en M3 Ultra, lo que sugiere 60+ en M5 Ultra.
- DeepSeek V4 128B en 4-bit cuantizado a 2.5-bit (~50 GB): el sweet spot para coding agents, porque entra un modelo de frontera a precio de RAM.
- Mixtral 8x22B en 4-bit (~90 GB): borderline, necesita todo el unified memory, pero corre. Ideal para fine-tuning ligero con LoRA.
Lo que sigue sin entrar (ni debe): un modelo denso de 400B o un MoE de 2T en precisión BF16. Para eso seguimos necesitando data center, como vimos en Qwen3.8-2.4T-A95B. El M5 Ultra no rompe esa frontera: la empuja varios escalones hacia abajo, y para un escritorio es la diferencia entre "experimento de domingo" y "flujo de trabajo diario".
El ángulo que nadie está mirando: agentes always-on
Acá es donde el M5 Ultra se cruza con la conversación sobre agentes locales que veníamos teniendo con Muse Glimmer y Swiftlet. Un agente always-on necesita tres cosas a la vez: memoria grande para cargar el modelo completo, bandwidth alto para que la latencia no degrade la interacción, y estabilidad de horas sin throttle. Los Mac Studio actuales con M3 Ultra ya eran decentes en el primero y el tercero, pero regulares en el segundo. El M5 Ultra cierra el triángulo.
Si sumás esto a la tendencia de los modelos a hacerse más chicos en activos pero más grandes en totales — como el Qwen3-Next-80B con 3B activos, o el futuro Qwen 3.8-Flash-Next que está por salir — el escenario "agente que vive en tu Mac, con tu context window de 128k, y responde a 30+ tokens/segundo" deja de ser ciencia ficción. Es un setup que un developer con presupuesto de workstation puede armar a fin de mes.
El detalle que falta verlo, y que la nota de Apple no aclara, es el precio. El Mac Studio con M3 Ultra arrancó en USD 4.000 con la configuración base de 64 GB, y subía a USD 5.800 con 192 GB. Si el M5 Ultra mantiene esa escala — y todo indica que sí — el setup interesante (probablemente 128 GB o 192 GB) va a estar en el rango de los USD 5.000-7.000. Caro para una Mac, barato para un cluster de GPUs que entregue el mismo throughput sostenido. Y sin ventilador de servidor en la pieza de al lado.
Verificación pendiente: el precio y la disponibilidad
Por ahora, Apple sólo publicó el press release del chip. La página del Mac Studio con M5 Ultra todavía no estaba online al momento de escribir este post, así que no puedo confirmar precio final ni fecha exacta de disponibilidad. Lo que sí está confirmado es que sale este trimestre y que las configuraciones con 192 GB de unified memory van a existir. Cuando estén los benchmarks reales de llama.cpp, mlx-lm y Ollama corriendo en M5 Ultra, los números que di arriba se ajustarán — pero el orden de magnitud es el correcto. Es la primera Mac donde un developer puede correr un modelo frontier como setup por defecto, no como demostración.
Si venís trabajando con IA local en serio, este es el hardware que tenés que mirar las próximas semanas. No es un upgrade de la línea: es un cambio de categoría.