Inteligencia Artificial

Muse Code: Meta entra en la terminal, y los benchmarks no cuadran

Autorangel cruz
Publicado
Lectura9 min de lectura
Muse Code: Meta entra en la terminal, y los benchmarks no cuadran

El 5 de agosto de 2026 Meta lanzó Muse Code en beta: un agente que vive en tu terminal, se instala con un comando y va sobre un modelo nuevo, Muse Spark 1.2. La lectura fácil es "Meta ya tiene su Claude Code". Y es cierta, pero es la parte aburrida.

Hay dos cosas más interesantes. La primera es una decisión de arquitectura que no había visto en los demás agentes de terminal. La segunda es que el número con el que Meta abrió el anuncio no aparece en el leaderboard verificado del benchmark que cita, y cuando alguien independiente lo midió, salió más bajo.

Vamos por partes, porque la diferencia entre las dos cosas importa: una es un diseño que puedes probar, la otra es marketing que conviene saber leer.

Qué es y qué necesitas para probarlo

Muse Code es un agente de línea de comandos. Se instala así:

curl -fsSL https://dev.meta.ai/install.sh | bash

Los datos secos, para situarlo:

Estado Beta pública (5 de agosto de 2026)
Plataformas macOS y Linux
Modelo Muse Spark 1.2
Ventana de contexto 1M de tokens
Acceso Muse Code y la Meta Model API

Nada de Windows por ahora, ni siquiera vía WSL documentado. Y sí, es un curl | bash: mírate el script antes de pasarlo por la shell, que es un consejo que aplica igual aquí que con cualquier otro instalador de este tipo.

Los agentes que no se mueren

Esta es la parte que merece atención técnica. En el modelo mental al que ya estamos acostumbrados, un subagente nace para una tarea, la hace, devuelve un resumen y desaparece. Todo lo que aprendió por el camino se va con él. La siguiente tarea que necesite ese mismo contexto lo vuelve a levantar desde cero: otra vez leer los mismos archivos, otra vez reconstruir el mismo mapa del repo.

Meta lo invierte. Sus agentes de background son persistentes durante toda la sesión, no se lanzan por tarea. Acumulan contexto mientras trabajas y deciden por su cuenta cuándo reportarle un hallazgo al agente principal. La justificación oficial es reducir la latencia en problemas de muchos pasos, y el razonamiento se sostiene: si el agente que ya entendió tu capa de datos sigue vivo, la tercera tarea que la toque no paga el coste de redescubrirla.

Cuando el trabajo es lo bastante grande, además se abre en subagentes en paralelo, cada uno en su propio worktree aislado, sin tocar tu copia de trabajo. Zuckerberg contó que en pruebas internas le hicieron construir seis funcionalidades de un juego a la vez sin colisiones entre ellas.

Y hay un tercer detalle que me parece el más sensato de los tres, aunque sea el menos vistoso: un event log local donde se va apilando cada llamada al modelo, cada ejecución de herramienta, cada aprobación y cada edición. Eso hace la sesión reproducible tal cual y segura ante reinicios. Si el agente se cae a mitad de una tarea de dos horas, no vuelves al principio. Cualquiera que haya perdido una sesión larga entiende de inmediato por qué esto vale más que un punto de benchmark.

Encima de todo eso vienen tres skills incluidas: /plan, que planifica y espera tu aprobación antes de tocar nada; /grill, que somete el trabajo hecho a presión buscando dónde se rompe; y /goal, que empuja hasta completar un objetivo.

Los benchmarks, y por qué hay que mirarlos dos veces

Aquí es donde conviene bajar el ritmo. Estos son los números que publicó Meta:

Benchmark Muse Spark 1.2 Comparación que presenta Meta
Terminal-Bench 2.1 82,9% Opus 5 (max) 86,7%, GPT-5.6 Terra 81,8%, Grok 4.5 81,6%
DeepSWE 1.1 59,3% Opus 5 65,0%, GPT-5.6 Terra 64,8%
Bench interno de Meta 70,6% GPT-5.6 Terra 65,4%, Gemini 3.6 Flash 63,9%

Fíjate en la forma de la tabla antes que en los números: Meta gana en su propio benchmark interno y pierde en los dos públicos. Eso ya te dice algo, y hay que reconocerle que los publicó de todas formas.

Pero el 82,9% de Terminal-Bench tiene dos problemas.

Uno: no está en el leaderboard verificado. Terminal-Bench mantiene una tabla pública donde las entradas tienen que haberse ejecutado con el harness oficial. A día de hoy Muse Spark 1.2 no figura ahí. Lo único de Meta en esa lista es la versión anterior, Muse Spark 1.1, con un 76,2% ± 1,2% corriendo bajo mini-SWE-agent. Y los números de los rivales en el leaderboard verificado tampoco coinciden con los que presenta Meta: arriba están Claude Code con Fable 5 (83,8% ± 1,2%) y Codex con GPT-5.5 (83,1% ± 1,1%), no un Opus 5 a 86,7%.

Dos: cuando alguien de fuera lo midió, salió menos. Artificial Analysis evaluó Muse Spark 1.2 de forma independiente y le dio un 80% en Terminal-Bench v2.1. Casi tres puntos por debajo de lo que anunció Meta. En su índice general lo sitúan en 54, empatado con Grok 4.5 y por detrás de Opus 5 (61), Fable 5 (60) y GPT-5.6 Sol (59).

Nada de esto es una acusación de fraude, y es importante decirlo. Un benchmark agéntico depende del harness, del nivel de esfuerzo configurado, del entorno y del día en que lo corres. Neil Shah, de Counterpoint Research, puso el dedo exactamente ahí al comentar el lanzamiento: una comparación entre proveedores solo significa algo si los modelos se miden con herramientas de terceros o dentro del mismo harness. Meta corrió a cada modelo en su propio agente, y esa es una decisión defendible (es como los va a usar la gente) que a la vez hace la comparación difícil de auditar.

La conclusión práctica es tibia y verdadera: Muse Spark 1.2 está en el pelotón de cabeza, no lo lidera. Y si a ti te importa el número exacto, el único que puedes usar sin asterisco es el de quien no vende el modelo.

El precio, que es la jugada de verdad

Los benchmarks son un empate técnico. El precio no.

Input Output Input cacheado
Estándar 1,25 $ / 1M 4,25 $ / 1M 0,15 $ / 1M
Contributor 0,10 $ / 1M 0,20 $ / 1M 0,002 $ / 1M

Lee la segunda fila otra vez. El input es doce veces más barato y el output veintiuno. Eso no es un descuento, es otra categoría de producto.

La contrapartida está escrita y es simple: en el tier contributor, Meta usa tus prompts y las respuestas del modelo para entrenar los siguientes. En el estándar, no. Alexandr Wang, que dirige la división de IA de Meta, apuntó justo a eso al presentarlo: para muchos flujos de trabajo esto puede ser una opción muy buena desde el punto de vista del coste.

Y tiene razón, con matices que dependen de quién eres:

  • Trabajas sobre código de un cliente, o bajo un NDA, o en una empresa con cualquier política de datos. El tier contributor no es una opción. No hay debate ni hay que pensarlo.
  • Es tu proyecto personal, o un repo open source que ya es público. Entonces la pregunta cambia de sentido. Estás regalando algo que ya regalaste, a cambio de un descuento del 90% y pico. Cuesta argumentar en contra.
  • Estás en medio. Un side project que quizá monetices, código propio que no quieres ver reflejado en el modelo de nadie. Ahí es donde toca decidir de verdad, y el precio está calibrado precisamente para tentarte.

Que nadie más ofrezca esto no es casualidad. Meta puede vender inferencia a pérdida porque no vive de vender inferencia, y a cambio consigue lo que ya no se puede comprar: código real, en repos reales, con las correcciones humanas que vienen después de cada error del agente. Los datos de entrenamiento de coding de calidad son el cuello de botella del sector. Este pricing es un embudo para conseguirlos.

Aquí es donde también aparece la advertencia de los analistas. Lian Jye Su, de Omdia, señaló el riesgo de dependencia y de lock-in a largo plazo, y dudó de que co-entrenar modelo y agente le dé a Meta una ventaja clara, porque el resto está haciendo lo mismo. Pareekh Jain lo dejó en la única prueba que cuenta: mejores resultados en proyectos de empresa con menos intervención humana.

Lo que sí puedes concluir hoy

Sin haberlo usado en producción, y con la beta recién salida, esto es lo que se sostiene:

Los agentes persistentes son una idea buena y comprobable. No dependen de ningún benchmark. O notas que la quinta tarea de la sesión arranca con contexto o no lo notas, y lo sabrás en una tarde. Es la parte del anuncio que me haría instalarlo.

El event log es la clase de detalle que delata a quien ha sufrido el problema. Reproducibilidad exacta y recuperación tras un reinicio no se le ocurren a nadie que no haya perdido una sesión larga a mitad.

El modelo está a la altura, no por encima. Un 80% independiente en Terminal-Bench es un resultado serio. No es liderazgo, y la distancia con la cabeza es de unos pocos puntos, que en la práctica se te van a notar menos que la diferencia de precio.

La decisión de verdad es sobre tus datos, no sobre el agente. Casi todo el atractivo de Muse Code está en esa segunda fila de la tabla de precios. Si tu contexto de trabajo te la prohíbe, lo que queda es un agente competente y algo más barato que la competencia, en beta, sin Windows. Suficiente para probarlo, no para mudarte.

Lo que me queda es una curiosidad concreta y bastante medible: si los agentes persistentes cumplen, es una idea que los demás van a copiar en meses. Esa parte se resuelve usándolo, no leyendo tablas.

Fuentes