Recursos

¿Me paso de Claude Code a Codex? La tabla completa: GPT-6 Astra vs Claude Fable 5.1 vs Claude Opus 5

GPT-6 Astra vs Fable 5.1 vs Opus 5 prueba a prueba: precios, regresiones, quién dice cada cifra y veredicto por caso de uso.

  • #modelos
  • #claude-code
  • #openai

Usas Claude Code y hoy te pica la duda: ¿me paso a Codex por GPT-6 Astra? Aquí tienes la respuesta partida en dos: lo que dice OpenAI de su propio modelo y lo que mide Artificial Analysis por su cuenta. Cada cifra lleva su fuente. Donde no hay dato público verificado va un guion, no un número inventado. Y al final, el veredicto según lo que hagas tú, no según el bando.

La tabla, prueba a prueba

Los tres modelos que importan si estás en Claude Code: GPT-6 Astra (OpenAI, 3-sep-2026), Claude Fable 5.1 (el frontier de Anthropic) y Claude Opus 5 (Anthropic, 24-jul-2026, el “casi el top a mitad de precio”).

PruebaQué mideGPT-6 AstraClaude Fable 5.1Claude Opus 5Fuente
Coding Agent IndexRendir como agente de código dentro de su herramienta (Codex, Claude Code)6770 (en Claude Code)a la par de Astra, sin cifra públicaArtificial Analysis (análisis independiente)
Intelligence IndexInteligencia general: media de pruebas de razonamiento, código y conocimiento61 (igual que GPT-5.6 Sol)+5 sobre Astra (≈66)—Artificial Analysis (análisis independiente)
Terminal-Bench 4.0Tareas reales en una terminal: instalar, configurar, arreglar por línea de comandos57,7%55,8%—OpenAI (anuncio 3-sep-2026)
OSWorld 2.0Manejar un ordenador: abrir apps, clicar, terminar tareas de escritorio72,6%, con ~47% menos tiempo por tarea que Sol—supera a Fable 5, sin cifra públicaOpenAI (3-sep-2026) · Anthropic (24-jul-2026)
ExploitBenchEncontrar y explotar vulnerabilidades de seguridad100%——OpenAI (anuncio 3-sep-2026)
FrontierMath Tier 4Matemáticas de nivel investigación98%——OpenAI (anuncio 3-sep-2026)
ARC-AGI-3Razonar sobre problemas que no ha visto nunca99,9%—3x el siguiente mejor (julio), sin cifra públicaOpenAI (3-sep-2026) · Anthropic (24-jul-2026)
CursorBench 3.2Programar dentro de Cursor—referenciadentro del 0,5% de Fable 5, a mitad de costeAnthropic (24-jul-2026)
Tasa de alucinaciónCuántas veces se inventa la respuesta en vez de decir que no la sabe51% (venía del 92%), a máximo esfuerzo, con +4 puntos de exactitud——Artificial Analysis (análisis independiente)
GDPval-AA v2Tareas de trabajo real con valor económico−80 Elo respecto a Sol (empeora)——Artificial Analysis (análisis independiente)
SciCodeProgramar soluciones a problemas científicos−2 a −3 puntos respecto a Sol (empeora)——Artificial Analysis (análisis independiente)
τ³-BankingAgente con reglas y herramientas atendiendo un caso de banca−2 a −3 puntos respecto a Sol (empeora)——Artificial Analysis (análisis independiente)
Razonamiento de contexto largoMantener el hilo con mucho texto de entrada−2 a −3 puntos respecto a Sol (empeora)——Artificial Analysis (análisis independiente)
AA-BriefcaseTareas largas, de muchos pasos+80 puntos respecto a Sol——Artificial Analysis (análisis independiente)
Eficiencia en tokensCuántos tokens gasta para resolver lo mismo70% más eficiente que Sol——Artificial Analysis (análisis independiente)

— = sin dato público verificado a fecha de esta tabla. Ojo con el referente: las filas de regresiones, tokens y AA-Briefcase comparan Astra con GPT-5.6 Sol, su antecesor, no con Claude. Las dos primeras filas sí enfrentan Astra con Fable 5.1 directamente.

Precio y coste: mira contra quién se compara

ModeloEntrada / salida (por millón de tokens)LecturaFuente
GPT-6 Astra$10 / $502,5x el precio de GPT-5.6 Sol. A máximo esfuerzo, ~75% más caro por tarea que SolArtificial Analysis (análisis independiente)
Claude Opus 5$5 / $25El mismo precio que Opus 4.8. Anthropic lo presenta como “la mitad de precio” que Fable 5Anthropic (24-jul-2026)
Claude Fable 5.1—Sin precio verificado para esta tabla—

Y la fila que parece contradecir la anterior hasta que miras el referente:

ComparaciónDatoReferenteFuente
Coste por tarea de códigoAstra cuesta menos de la mitadfrente a Fable 5OpenAI (dato propio, sin verificación independiente)
Coste por tarea a máximo esfuerzoAstra cuesta ~75% másfrente a GPT-5.6 SolArtificial Analysis (análisis independiente)

Las dos cosas pueden ser verdad a la vez porque cada una se compara con un modelo distinto. Si vienes de Claude Code, la cifra que te afecta es la primera. Y es justo la que solo dice OpenAI.

Dónde lo tienes:

  • Astra: ChatGPT Plus, Pro, Business y Enterprise, API y AWS. Despliegue por fases; el programa de ciberseguridad va primero y por solicitud.
  • Opus 5: API, Claude Max (es el modelo por defecto), Claude Pro, Claude Code y Claude Cowork.

Lo que empeora (y OpenAI no cuenta)

Medido por Artificial Analysis, respecto a GPT-5.6 Sol:

  • GDPval-AA v2: −80 Elo. Tareas de trabajo real con valor económico. Es la caída más gorda.
  • SciCode: −2 a −3 puntos. Código para problemas científicos.
  • τ³-Banking: −2 a −3 puntos. Agente con reglas y herramientas en un caso de banca.
  • Razonamiento de contexto largo: −2 a −3 puntos. Mantener el hilo con mucho texto de entrada.

Un modelo nuevo no mejora en todo. Este, en cuatro pruebas, retrocede respecto al anterior.

Lo que sí mejora de verdad

  • Manejar el ordenador: OSWorld 2.0 al 72,6%, con ~47% menos tiempo por tarea que Sol. (OpenAI)
  • Terminal: Terminal-Bench 4.0 al 57,7% frente al 55,8% de Fable 5.1. Casi dos puntos. (OpenAI)
  • Alucina menos: del 92% al 51% a máximo esfuerzo, con 4 puntos más de exactitud. (Artificial Analysis)
  • Sesiones largas en Codex: mantiene notas entre ventanas de contexto en vez de recomprimir todo en un resumen, y las ventanas anteriores siguen siendo buscables. Para depurar durante horas, es lo que evita perder el porqué del primer intento fallido. (OpenAI)
  • Velocidad en Codex: su agente va 1,9x más rápido que con Sol en Mind2Web. (OpenAI)
  • Tokens: 70% más eficiente que Sol. (Artificial Analysis)
  • Tareas largas: +80 puntos en AA-Briefcase. (Artificial Analysis)

Veredicto por caso de uso

  • Agentes de código en Claude Code → hoy, sin motivo para cambiarte. 70 de Fable 5.1 frente a 67 de Astra, y cinco puntos más de inteligencia general. Astra queda a la par de Opus 5 y Fable 5, no por encima.
  • Manejar el ordenador, automatizar el escritorio → Astra da un salto real: 72,6% y casi la mitad de tiempo por tarea. Ojo: Opus 5 también supera a Fable 5 en esta prueba según Anthropic, y no hay comparación directa Astra-Opus 5 aquí.
  • Terminal y tareas de sistema → Astra ligeramente por delante: casi dos puntos sobre Fable 5.1. Ventaja real, no abismo.
  • Ciberseguridad → Astra, 100% en ExploitBench. Pero con acceso restringido, por fases y por solicitud. Puede que hoy ni te lo den.
  • Ciencia y matemáticas → Astra: 98% en FrontierMath Tier 4 y 99,9% en ARC-AGI-3.
  • Sesiones largas de depuración en Codex → mejora real por las notas entre ventanas de contexto. Es el argumento más sólido para probar Codex si tu trabajo son horas seguidas sobre el mismo bug.
  • Pagas por token a máximo esfuerzo → mira el referente antes de decidir. Astra sale ~75% más caro por tarea que Sol (independiente) y menos de la mitad por tarea de código que Fable 5 (lo dice OpenAI). Haz la cuenta por tarea completa, no por token.
  • Quieres lo más barato de Anthropic con casi el top → Opus 5: $5/$25, dentro del 0,5% de Fable 5 en CursorBench 3.2 y por encima de Fable 5 en OSWorld 2.0 a poco más de un tercio del coste.
  • Trabajo de oficina con valor económico, código científico, banca con herramientas o contexto largo → Astra retrocede respecto a Sol. No hay cifra de Claude en esas pruebas para compararlo, así que tampoco es un argumento para cambiarte.

Sin bandos: Astra gana en unas cosas y pierde en otras. Lo que decide es lo que haces tú cada día.

Fuentes y fecha

Los índices de Artificial Analysis se actualizan. Esta tabla es una foto a 4 de septiembre de 2026: si la lees semanas después, revisa los números antes de decidir.

Regla de oro

Cambia de herramienta por lo que haces, no por el titular. Y cuando una cifra te impresione, pregunta dos cosas: contra quién se compara y quién la mide.


Sígueme para más trucos con Claude Code e IA → @pabloinpublic

Más recursos → pabloinpublic.com/recursos

o sígueme en Instagram → @pabloinpublic