El 24 de julio Anthropic publicó Claude Opus 5. Mirando solo el número de versión, esto es Opus 4.8 corrido un casillero y no hay mucho por qué emocionarse. El cambio real no está en la columna de puntajes, está en la de precios: capacidad cercana a la del escalón superior metida en el casillero de precio que Opus ya ocupaba. Contra 4.8, al mismo dinero, es una mejora limpia; contra Fable 5 es la mitad del precio para casi todo el trabajo. Lo que se paga es silencioso, y quien cambie solo el ID del modelo lo va a pisar.

El cuarto modelo en menos de dos meses, y este sí merece una pausa

Primero el encuadre. Todos los puntajes de este texto vienen de la publicación oficial y de recopilaciones públicas: yo no corrí estos benchmarks. ARC-AGI o GDPval no son cosas que uno reproduzca en su laptop. Además los benchmarks cambian entre versiones, así que rige lo que muestre la página oficial en ese momento. Mira la tendencia, no el decimal.

El ritmo de lanzamientos de Anthropic en el último tramo asusta un poco: Mythos 5, Fable 5, Sonnet 5, y después Opus 5 el 24 de julio; cuatro modelos en menos de dos meses. El efecto secundario es que la gente empezó a saltarse las notas de lanzamiento, total el mes que viene hay otro.

Este merece diez minutos, y no porque sea más fuerte, sino por el escalón de precio en el que es fuerte. La posición oficial de Opus 5 es: inteligencia de frontera cercana a la de Fable 5 manteniendo el precio de Opus. En cristiano, el nivel de capacidad que antes había que pagar un escalón más arriba ahora se consigue casi entero un escalón más abajo. En Claude Max quedó como modelo por defecto, y en Pro es lo más potente a lo que llegas.

Algunas especificaciones para tener a mano: 5 dólares por millón de tokens de entrada y 25 dólares por millón de tokens de salida; ventana de contexto de 1M de tokens; tres niveles de razonamiento intercambiables — low, medium y high — más un nivel xhigh. Y una línea que no está en la parte visible de la ficha técnica y que mueve la factura más que ninguna: el thinking viene activado por defecto. Eso merece sección propia, y la tiene: la cuarta.

Contra Opus 4.8: ni un centavo más, ni un punto peor

Conclusión primero: es una mejora al mismo precio, y de las que puedes adoptar sin darle demasiadas vueltas.

Opus 4.8 salió el 28 de mayo a 5 / 25 dólares. Opus 5 vale exactamente lo mismo. Por eso esta es la más limpia de las dos comparaciones: no hay que calcular relación precio-rendimiento, alcanza con mirar la diferencia de capacidad.

Ítem Opus 4.8 Opus 5
Precio (por millón de tokens) 5 USD entrada · 25 USD salida 5 USD entrada · 25 USD salida
SWE-bench Pro 69,2% 79,2%
Promedio de benchmarks de razonamiento 72,1 90,4
Frontier-Bench v0.1 Según la empresa, Opus 5 rinde alrededor del doble que 4.8 y gasta menos por tarea
Benchmarks ganados en la comparación pública 0 6

SWE-bench Pro de 69,2% a 79,2% son diez puntos enteros, y esa es la fila que primero se nota si escribes código. El promedio de razonamiento, 90,4 contra 72,1, abre todavía más. En Frontier-Bench v0.1 la versión oficial es que Opus 5 rinde alrededor del doble que 4.8, y gastando menos por tarea.

Lo que más me dice, igual, no es ningún puntaje suelto: es el seis a cero. En la comparación pública Opus 5 queda mejor en seis benchmarks — BrowseComp, DeepSWE 1.1, FrontierCode 1.1, GDPval-AA, HealthBench Professional y Humanity's Last Exam — y Opus 4.8 no queda mejor en ninguno.

De esos seis, a ti te tocan uno o dos. BrowseComp es búsqueda web, DeepSWE y FrontierCode tiran a programación, GDPval-AA tira a tareas profesionales reales, HealthBench Professional es del área médica y Humanity's Last Exam es un set de preguntas armado a propósito para complicar. Así que el dato útil no es que ganó seis: es que no perdió ninguno.

Lo molesto de cambiar de modelo nunca fue que el nuevo no rinda. Es que alguna capacidad de la que dependes calladamente retroceda medio paso. Tus prompts están calibrados al carácter del modelo viejo; el nuevo sube tres puntos en una tabla que nunca miras y baja dos en el paso que usas todos los días, y te enteras cuando algo se rompe en producción. Cero retrocesos define el cambio mejor que cualquier puntaje individual.

Así que, si ya estás en 4.8: del lado de la capacidad el riesgo de mudarse es bajo. Del lado del costo no; sigue leyendo.

Contra Fable 5: la mitad del precio, y la distancia quedó en esto

Este es el verdadero titular del lanzamiento. Fable 5 es el escalón de arriba, a 10 dólares por millón de entrada y 50 por millón de salida. Opus 5 son 5 y 25: exactamente la mitad.

Comparación Opus 5 Fable 5
Precio (por millón de tokens) 5 USD entrada · 25 USD salida 10 USD entrada · 50 USD salida
Frontier-Bench 43,3% 33,7%
GDPval-AA v2 1.861 1.747
Promedio en tareas agénticas 90,8 84,6
SWE-bench Pro Se llevan menos de un punto, prácticamente empatados
ARC-AGI 3 Se reporta a Opus 5 en torno al triple del segundo mejor modelo: la mayor diferencia puntual de este lanzamiento

Todas esas filas dicen lo mismo: en estas mediciones Opus 5 ya alcanzó o pasó al escalón de arriba, a mitad de precio. Frontier-Bench 43,3% contra 33,7%, GDPval-AA v2 1.861 contra 1.747, tareas agénticas con promedio 90,8 contra 84,6, y SWE-bench Pro con menos de un punto de diferencia.

ARC-AGI 3 merece párrafo aparte. Ahí se reporta a Opus 5 en torno al triple del segundo mejor modelo, la mayor diferencia puntual de este lanzamiento. Lo que mide ARC-AGI no es cuánto aprendió el modelo, sino si puede deducir algo en frío: le das un conjunto de reglas que nunca vio y observas si encuentra el patrón. Un puntaje alto no significa que sepa más; significa que se traba menos ante problemas desconocidos.

¿Por qué le importa a un usuario común? Lo que de verdad te frena en el día a día casi nunca es una pregunta con respuesta establecida: eso los modelos actuales ya lo resuelven bien. Lo difícil es el trabajo del que nadie escribió tutorial, ese que ni tú puedes describir del todo. Dicho eso, un benchmark queda lejos de lo que tienes sobre el escritorio: ese triple no se siente como el triple en el uso diario.

Fable 5 tampoco quedó jubilado. Para los trabajos que necesitan las corridas autónomas más largas — dejar al modelo andando horas, planificando y corrigiéndose solo, sin manos encima — la recomendación oficial sigue siendo Fable 5. Si tu forma de usarlo es tirar una tarea grande por encima del muro e irte a dormir, esa línea decide por ti, y ahorrar la mitad del precio unitario no es motivo para mudarte.

Una más que no aparece en ninguna tabla y sí en el día a día: se dice que el clasificador de seguridad de Opus 5 se dispara por error alrededor de un 85% menos que el de Fable 5. Para quien hace investigación de seguridad, escribe scripts de pruebas de penetración o maneja textos financieros y médicos, eso puede valer más que cualquier puntaje: cada vez que te rechazan trabajo legítimo pierdes tiempo reescribiendo el prompt para esquivarlo, y ese desgaste no entra en ninguna evaluación.

En corto: contra 4.8 es el mismo precio y nada empeoró. Contra Fable 5 es la mitad del precio y alcanza para casi todo, salvo las corridas autónomas muy largas.

Ahora el agujero de plata: el thinking viene activado

Lee esto antes de cambiar el ID

En Opus 5 el thinking viene activado por defecto. El mismo prompt produce más tokens de salida que con el razonamiento apagado, y la salida cuesta cinco veces la entrada (25 dólares contra 5). El resultado: cambiaste un ID de modelo, la lista de precios no se movió ni un centavo, y a fin de mes la factura subió.

No es un defecto: cambió un valor por defecto. Los cambios de valores por defecto no aparecen en la página de precios, solo en la factura, y por eso se pasan por alto tan fácil.

El que más chances tiene de caer es este: venía corriendo un lote de tareas baratas en Opus 4.8 con el thinking apagado — clasificar, enrutar, comprimir textos largos en resúmenes, convertir formatos. Nada de eso necesita que el modelo piense mucho, y apagar el razonamiento lo hace rápido y barato. Aparece Opus 5, mismo precio y más fuerte, y una línea de código cambia el ID del modelo sin tocar nada más. La capacidad subió, sí. El volumen de salida también, y sobre un precio unitario multiplicado por cinco.

Cuatro defensas, ordenadas por rendimiento:

  1. Compara el volumen de salida en una muestra chica antes de cambiar. Toma veinte o treinta pedidos reales tuyos, pásalos por los dos modelos y anota el total de tokens de salida. Son diez minutos y es la única forma de ver el cambio de factura antes de que llegue.
  2. Ajusta el nivel de razonamiento a la tarea en vez de usar uno para todo. Low, medium y high están para usarse, y arriba está xhigh. Al trabajo simple en volumen dale el nivel bajo; sube cuando necesites razonar entre archivos o estés cazando un bug difícil. El criterio no es qué tan importante es la tarea, sino si necesita que el modelo piense unos pasos más: donde no hace falta, más presupuesto de razonamiento es solo más dinero.
  3. Mira el volumen de salida, no el precio unitario. Un pedido cuesta volumen de entrada × precio de entrada + volumen de salida × precio de salida. Lo que cambió acá es el término del volumen de salida; las columnas de precio no se movieron, así que la lista de precios nunca te va a mostrar el problema.
  4. Para el trabajo de verdadero volumen, mira hacia abajo. Bajar Opus 5 al nivel de razonamiento mínimo para hacer resúmenes suele rendir menos que pasarse directamente a un modelo más barato. Un tope de gama se paga en los problemas difíciles, no en el caudal.

De paso, sobre la ventana de contexto de 1M: una ventana es un techo, no una meta. Volcar un repositorio entero o un año de registros ahí adentro se paga de verdad del lado de la entrada, y el modelo no necesariamente acierta más.

Tres tipos de trabajo, tres decisiones

Comprimiendo todo lo anterior en algo que puedas usar:

Programar, analizar y trabajo de conocimiento del día a día → Opus 5. Este escalón ahora gana por los dos lados: mismo precio que 4.8 y sin retrocesos, mitad de precio que Fable 5 y con casi toda la capacidad. Si ya estás en 4.8, cámbiate; solo corre primero la comparación de volumen de salida de la sección anterior.

Trabajos donde el modelo tiene que correr solo mucho tiempo → Fable 5 sigue siendo ese escalón. Cadenas largas, horas sin cortarse, autocorrección a mitad de camino: sigue siendo su cancha. No es la forma de trabajar de mucha gente, pero si es la tuya, no compres solo por precio unitario.

Tareas simples en volumen → hacia abajo, no hacia arriba. Clasificar, etiquetar, enrutar, resumir con plantilla: ahí se compite por costo unitario y caudal, no por inteligencia. Usar un tope de gama es puro desperdicio, incluso bajado al nivel de razonamiento mínimo.

Y una regla general arriba de todo: suma el gasto total, no el precio unitario. Dos modelos al mismo precio, uno charlatán y otro parco, pueden dejar facturas bien distintas; al revés, un modelo que cuesta el doble pero acierta a la primera y te ahorra tres rondas de retrabajo puede terminar más barato. Lo que hay que mirar es cuánto costó terminar el trabajo, no el número de la lista.

Para los lectores del mundo cripto que usan IA como herramienta de trabajo: revisar el código que manda órdenes y calcula el tamaño de posición, chequear permisos de API y manejo de errores — trabajo donde un error cuesta dinero real — vale Opus 5. Comprimir un día de anuncios y publicaciones en un resumen va en un escalón más barato. Dejar un agente mirando datos toda la noche es la cancha de Fable 5. El límite no se movió, igual: todo esto es procesamiento de información, no juicio en tu lugar. Un modelo puede repasar contigo cómo se leen las velas y encontrarle agujeros a tu lógica, pero no sabe si mañana sube o baja; y las noticias que te arma pueden estar inventadas, sobre todo las que se leen más redonditas. Las estafas viejas recicladas con envoltorio de IA las conté en las 8 formas de estafa cripto.

Una última cosa, que quizá importe más que qué modelo eliges: no sueldes tu flujo de trabajo a un ID de modelo. Cuatro modelos en menos de dos meses significa que lo que elijas hoy difícilmente sea lo más fuerte ni lo más barato dentro de dos meses. Deja el ID del modelo, el nivel de razonamiento y el tope de costo en configuración, para que cambiar sea una línea; y guarda un grupito de tareas reales tuyas como prueba de regresión, para correrla cada vez que sale algo nuevo: en quince minutos sabes si conviene cambiar. La vez pasada que escribí sobre elegir modelo fue los tres niveles de GPT-5.6, y la conclusión de ese texto sigue en pie casi entera; no porque los puntajes no hayan cambiado, sino porque separar por tarea y usar el nivel que alcanza no envejece mucho.

Preguntas que seguramente estás por hacer

¿Cuánto mejor es Claude Opus 5 que Opus 4.8?

Según la publicación oficial y las recopilaciones públicas, SWE-bench Pro sube de 69,2% a 79,2%, el promedio de los benchmarks de razonamiento es 90,4 contra 72,1, y en Frontier-Bench v0.1 la empresa afirma que Opus 5 rinde alrededor del doble que 4.8 gastando menos por tarea. En la comparación pública Opus 5 queda mejor en seis benchmarks y Opus 4.8 en ninguno. El precio es idéntico: 5 dólares por millón de tokens de entrada y 25 por millón de salida. Yo no corrí estos benchmarks, y los benchmarks cambian entre versiones, así que rige lo que publique la página oficial en ese momento.

¿Opus 5 puede reemplazar a Fable 5?

Para la mayoría del trabajo sí, y a mitad de precio: Fable 5 son 10 dólares por millón de entrada y 50 por millón de salida; Opus 5, 5 y 25. En los datos publicados Opus 5 marca 43,3% contra 33,7% en Frontier-Bench, 1.861 contra 1.747 en GDPval-AA v2, menos de un punto de diferencia en SWE-bench Pro y 90,8 contra 84,6 en tareas agénticas. Para los trabajos que necesitan las corridas autónomas más largas, en cambio, el escalón señalado sigue siendo Fable 5.

¿Por qué me subió la factura después de pasarme a Opus 5?

Lo más probable es que sea el thinking activado por defecto. Con el razonamiento encendido, el mismo prompt produce más tokens de salida, y la salida cuesta cinco veces la entrada. Si venías corriendo tareas por lote en Opus 4.8 con el thinking apagado y solo cambiaste el ID del modelo, el precio unitario quedó igual pero el volumen de salida no, así que la factura puede subir en vez de bajar. Compara el conteo de tokens de salida en una muestra chica antes de cambiar y después decide qué nivel de esfuerzo usar.

¿Qué nivel de esfuerzo conviene para programar todos los días?

Opus 5 ofrece los niveles de razonamiento low, medium y high, más xhigh. Para editar código y escribir scripts chicos, el nivel bajo suele alcanzar; sube cuando necesites razonar entre archivos, diseñar una interfaz o cazar un bug difícil. El criterio no es qué tan importante es la tarea, sino si necesita que el modelo piense unos pasos más: donde no hace falta, más presupuesto de razonamiento solo cuesta más.


Sigue leyendo: Los tres niveles de GPT-5.6 · 8 estafas cripto · Qué es Bitcoin