Cuando una armadora publica el rendimiento de un modelo nuevo, lo mide en una pista cerrada: sin baches, sin topes, sin el tráfico de la 11 Sur a las ocho de la mañana. El número es real. Solo que tu coche va a vivir en la calle.

Eso es lo que pasó esta semana con Claude Opus 5, y explicarlo bien vale más que la noticia misma. Porque el mismo lunes en que leas esto, alguien te va a decir —en una junta, en una propuesta, en un correo de tu proveedor de software— que "ya salió un modelo que le gana a todo y cuesta la mitad". Y va a ser cierto. También va a ser cierto que los evaluadores que lo pusieron a trabajar reportaron empates.

Las dos versiones caben en la misma semana. La distancia entre ellas es justo lo que un dueño de negocio necesita entender para no comprar un titular.

¿Qué anunció Anthropic el 24 de julio?

Empecemos por lo que está publicado con nombre y fecha. Anthropic publicó Claude Opus 5 el 24 de julio de 2026 al mismo precio de su antecesor Opus 4.8, y a la mitad de lo que cuesta Claude Fable 5, el modelo tope de la casa. Las tarifas exactas están tabuladas más abajo, en la sección de costo (página de precios de Anthropic, consultada el 26 de julio de 2026).

Sobre capacidad, la afirmación central del anuncio es textual: "On coding and knowledge work evaluations like Frontier-Bench and GDPval-AA, Opus 5 is the new state-of-the-art" — en evaluaciones de código y de trabajo de conocimiento, es el nuevo estado del arte (anuncio oficial). En ese mismo texto la empresa reconoce un límite propio: en tareas de ciberseguridad queda por detrás de otro de sus modelos, Mythos 5.

La documentación técnica agrega lo verificable línea por línea: ventana de contexto de un millón de tokens, razonamiento activado por defecto, cinco niveles de esfuerzo (low, medium, high, xhigh, max) y un modo rápido notablemente más veloz al doble del precio base (documentación oficial de Opus 5).

Hasta aquí no hay nada que discutir. Es la información de Anthropic sobre su propio producto, publicada con su nombre encima.

¿Qué encontraron los evaluadores independientes?

Tres organizaciones lo midieron por su cuenta en las primeras 48 horas, y no llegaron al mismo lugar que el anuncio.

Epoch AI, el más conservador de los tres, lo dejó por debajo de Fable 5 en su índice general de capacidades y empatado con él en la parte de ingeniería de software (reportado por Yellow, julio de 2026).

Artificial Analysis publicó el análisis más favorable, y también el más incómodo en un punto concreto: la exactitud factual mejoró, pero la tasa de alucinación subió catorce puntos (Artificial Analysis, 24 de julio de 2026). Conviene saber que esta casa declara abiertamente que apoyó a Anthropic a evaluar el modelo antes del lanzamiento. No la descalifica; es un dato que el lector merece tener a la mano.

CodeRabbit, que vive de revisar código ajeno, hizo la prueba más parecida a un día de trabajo: tomó patrones de error sacados de pull requests reales de proyectos abiertos y corrió cada configuración varias veces contra la línea base que ya tiene en producción (el detalle está en la tabla) (CodeRabbit, 24 de julio de 2026). Resultado: el modelo nuevo escribe comentarios más certeros, pero detecta menos errores conocidos y genera cuatro veces más ruido que lo que esa empresa ya usaba.

Ese contraste merece leerse dos veces. Anthropic afirma en su propia documentación que Opus 5 destaca en "code review and bug-finding, surfacing real bugs at a high rate per pass with few false positives" — revisión de código y detección de errores, con pocos falsos positivos. Y quien lo puso a revisar código real midió menos hallazgos y más ruido que su línea base.

Aquí está todo junto, para que leas los números sin intermediarios:

Qué se midió Quién lo midió Resultado
Código y trabajo de conocimiento (Frontier-Bench, GDPval-AA) Anthropic "El nuevo estado del arte". Las cifras se publicaron como imágenes de gráfica, no como tabla de texto
CursorBench 3.2 (esfuerzo máximo) Anthropic "Dentro de 0.5%" del mejor resultado de Fable 5 — empate técnico
Tareas de ciberseguridad Anthropic Reconoce que queda por detrás de su modelo Mythos 5
Índice general de capacidades (ECI) Epoch AI Opus 5: 159 · Fable 5: 161 → gana Fable 5
Ingeniería de software (SWE-ECI) Epoch AI Empate entre los dos
Índice de inteligencia (esfuerzo máximo) Artificial Analysis Opus 5: 61 · Fable 5: 60 · GPT-5.6 Sol: 59 → empate técnico
AA-Briefcase, trabajo agéntico largo (Elo) Artificial Analysis Opus 5: 1720 · Fable 5: 1574 → gana Opus 5
Humanity's Last Exam Artificial Analysis 53% los dos → empate
Terminal-Bench v2.1 (esfuerzo máximo) Artificial Analysis Opus 5: 89%, a la par del líder GPT-5.6 Sol
Conocimiento factual y alucinación (AA-Omniscience) Artificial Analysis Exactitud +7 puntos, pero la tasa de alucinación sube 14 puntos hasta 50%; sigue por debajo de Fable 5 en conocimiento factual
Detección de errores conocidos (~100 patrones de PRs reales, 3 corridas) CodeRabbit Opus 5 (x-high): 55.2% · línea base de producción: 61.1%
Precisión de los comentarios accionables (misma prueba) CodeRabbit Opus 5: 39.3% · línea base: 35.2%
Ruido ("nitpicks") en la misma prueba CodeRabbit Opus 5: 92 · línea base: 23
SWE-bench Pro, tablero público con arnés estandarizado Scale AI (SEAL) Ni Opus 5 ni Fable 5 aparecen en el tablero

Fuentes: Anthropic y su documentación de Opus 5; Epoch AI vía Yellow; Artificial Analysis; CodeRabbit; tablero público de SWE-bench Pro de Scale AI. Todas consultadas el 26 de julio de 2026.

¿Por qué las dos versiones pueden ser ciertas al mismo tiempo?

Esta es la parte que casi nadie te va a explicar, y es la razón de ser de este artículo.

Un modelo de lenguaje no se evalúa solo. Se evalúa dentro de un andamiaje: el programa que le pasa el problema, le da herramientas, le permite reintentar, decide cuántos pasos puede dar y cuándo se rinde. Ese andamiaje pesa. Puede valer la mitad del resultado.

Cuando la empresa que entrenó el modelo publica su puntaje, normalmente lo corre con el andamiaje que ella misma construyó y afinó para ese modelo — la versión pista cerrada, con la suspensión calibrada para esa pista. Cuando una organización neutral lo mide, lo mete en un arnés estandarizado, idéntico para todos los modelos, precisamente para que los números se puedan comparar entre sí. Y no dan lo mismo.

La distancia está documentada. Un análisis publicado el 16 de junio de 2026 encontró que tres sistemas de agente distintos corriendo el mismo modelo produjeron resultados diferentes en la misma prueba de programación, y atribuye a la elección del arnés variaciones de hasta 10 a 20 puntos sin cambiar una sola línea del modelo. En ese mismo análisis: de los cien modelos listados en un agregador popular a esa fecha, noventa y nueve tenían puntajes reportados por la propia empresa que los entrenó y solo uno traía verificación independiente (Digital Applied, junio de 2026).

Dicho de otro modo: dos puntajes de "la misma prueba" pueden no ser comparables si salieron de andamiajes distintos. Restarlos equivale a medir un coche en pista y el otro en hora pico, y anunciar quién ganó.

Hay un segundo motivo, más sencillo, y este lo comprobamos nosotros. Anthropic publicó casi todas sus cifras como imágenes de gráfica, no como tablas de texto. En el cuerpo del anuncio hay afirmaciones relativas —"supera a todos los modelos", "dentro de 0.5% del pico"— y los números viven dentro de las imágenes. Lo verificamos abriendo la página oficial, y coincide con lo que reportó Vellum el mismo día del lanzamiento: "Anthropic's charts for these benchmarks are published as images on the announcement page, not readable comparison tables".

La consecuencia práctica es incómoda: buena parte de las cifras exactas que circulan estos días en blogs y en redes salieron de que alguien miró una gráfica y estimó el número, no de un dato tabulado. Por eso hay cifras de Opus 5 que se contradicen entre un agregador y otro, y por eso en la tabla de arriba no vas a encontrar varios de los números que probablemente ya viste en LinkedIn. Los dejamos fuera a propósito: no pudimos confirmarlos contra el evaluador original.

El tercer motivo es el más humano de los tres. Quien entrena el modelo y quien lo evalúa desde fuera no están respondiendo la misma pregunta. Anthropic responde "¿de qué es capaz este modelo en su mejor día?". El evaluador independiente responde "¿qué hace este modelo cuando lo pongo a hacer el trabajo que ya estoy haciendo?". Las dos preguntas son legítimas. La segunda es la tuya.

¿Dónde pierde Opus 5?

Ninguna de las dos partes lo esconde, pero conviene ordenarlo.

La propia Anthropic admite una casilla: ciberseguridad, donde queda por detrás de Mythos 5. Artificial Analysis suma otra que no estaba en el guion — la tasa de alucinación al alza, con el conocimiento factual todavía por debajo de Fable 5.

Y hay cuatro casillas más que aparecieron en la lectura que hicieron creadores de contenido reconocidos del medio sobre las gráficas del anuncio. Las tomamos como lo que son —interpretación de un tercero sobre imágenes publicadas por Anthropic, no medición propia— y por eso las contamos sin cifras:

Lo dejamos ahí adrede. Cuál de estas casillas te importa depende de qué hace tu empresa, y eso no lo sabemos nosotros.

Lo que hoy nadie puede afirmar

A la fecha de publicación, ni Opus 5 ni Fable 5 aparecen en el tablero público de SWE-bench Pro de Scale AI, el arnés estandarizado que corre a todos los modelos en las mismas condiciones. Que un modelo lanzado hace tres días no esté ahí es normal.

Pero significa algo concreto: la prueba de programación más citada del gremio todavía no tiene una medición neutral de Opus 5. Quien hoy te diga lo contrario está citando el andamiaje de alguien.

¿Bajó el precio o va a bajar tu gasto?

Depende enteramente de dónde vienes, y es la parte donde más gente se va a confundir este mes.

Concepto Claude Opus 5 Claude Fable 5 Claude Sonnet 5
Precio por millón de tokens (entrada / salida) $5 / $25 $10 / $50 $2 / $10 hasta el 31-ago-2026; después $3 / $15
Modo rápido (vista previa de investigación) $10 / $50 No listado No listado
Por lote (Batch API, 50% de descuento) $2.50 / $12.50 $5 / $25 $1 / $5; después $1.50 / $7.50
Costo promedio por tarea del índice de inteligencia (esfuerzo máximo) $2.03 $2.75 (con respaldo) $1.53

Precios en dólares. Fuentes: página de precios de Anthropic y Artificial Analysis, consultadas el 26 de julio de 2026. Como referencia, el antecesor Opus 4.8 promedia $1.80 por tarea en ese mismo índice. Dos detalles que casi nunca se mencionan: el consumo de tokens de salida varía alrededor de ocho veces entre el nivel de esfuerzo más bajo y el más alto (Artificial Analysis), y los modelos Claude 4.7 en adelante usan un tokenizador que produce aproximadamente 30% más tokens para el mismo texto que los modelos 4.6 y anteriores (documentación de Anthropic) — comparar precios por token entre generaciones distintas subestima el gasto real.

Lee la última fila con calma. El titular "cuesta la mitad" es cierto contra un modelo específico: el tope de gama. Si tu proveedor venía usando ese modelo tope, sí hay ahorro. Si venía usando el modelo intermedio de la misma casa —el caso de casi cualquier empresa que no está quemando presupuesto de laboratorio—, el modelo nuevo sale más caro por tarea. Y contra su propio antecesor, también sube.

Nada de esto quiere decir que el gasto sea malo. Quiere decir que "bajó el precio" y "voy a gastar menos" son dos frases distintas, y que la segunda no se deduce de la primera.

Hay además una palanca de gasto que casi nadie discute porque no sale en los anuncios: el nivel de esfuerzo. Es un parámetro que decide cuánto piensa el modelo antes de responder, y mueve el consumo de tokens de salida en un rango de alrededor de ocho veces. La documentación de Anthropic recomienda arrancar en el nivel por defecto y moverse en cualquier dirección según las pruebas propias de cada quien. Existe además el reporte de un desarrollador —anecdótico, sin verificación independiente hasta donde pudimos comprobar— de que en una prueba de código el nivel medio rindió mejor que el alto, al revés de lo que uno esperaría.

Si alguien te está cotizando "trabajo con IA" sin decirte en qué nivel de esfuerzo corre, te está cotizando un rango de costo, no un costo.

Una digresión honesta sobre el precio anterior

Circuló entre creadores del medio una lectura que vale la pena poner sobre la mesa marcada como lo que es —una hipótesis comercial, no un hecho verificable—: que el modelo tope haya salido meses antes a un precio muy alto pudo funcionar como anclaje. Se fija una referencia elevada, y cuando llega el modelo siguiente a la mitad, la mitad se siente barata.

No tenemos forma de comprobarlo y quien la propuso tampoco la presentó como certeza. La mencionamos porque la técnica es vieja y la has visto en tu propio giro: el producto más caro del catálogo, ese que casi nadie compra y que existe sobre todo para que el de en medio se vea razonable.

¿Desde dónde estamos opinando nosotros?

De frente, porque es lo único que le da valor a este texto: en Kynoz construimos el software de nuestros clientes con estas herramientas, a diario. Escribimos y revisamos código con asistentes de IA, corremos agentes en tareas largas y pagamos esas facturas de tokens con dinero de la empresa. Opinamos desde el taller, no desde la tribuna.

Eso nos obliga a dos cosas. La primera es un aviso: ninguna de las empresas que aparecen aquí nos paga, no somos socios ni revendedores de ninguna, y no ganamos un peso si terminas usando uno u otro. La segunda es más incómoda: como usamos estas herramientas en trabajo que se entrega y se cobra, no nos podemos dar el lujo de creerle a un anuncio. Un modelo que promete revisar código y en la práctica deja pasar errores no nos cuesta un titular; nos cuesta la llamada de un cliente cuyo sistema dejó de funcionar.

Por eso esta pieza no te va a decir qué modelo usar. No conocemos tu operación, tu volumen ni qué pasa en tu negocio cuando algo falla — y quien te recomiende un modelo sin conocer esas tres cosas te está vendiendo, no aconsejando.

Si contratas software, ¿qué haces con todo esto?

Nada dramático. Cambiar cuatro preguntas de lugar.

Cuando tu proveedor te anuncie que "ya se actualizó al último modelo", esto es lo que separa una decisión informada de una compra por titular:

  1. ¿Ese número lo midió quién? Si lo publicó la empresa que entrenó el modelo, es información de producto legítima, medida en su propia pista. Si es de un evaluador independiente, pregunta con qué arnés lo corrió.
  2. ¿En qué se parece esa prueba a lo que hace mi empresa? Un puntaje alto resolviendo problemas de repositorios públicos no dice nada sobre timbrar un CFDI 4.0, sobre tu inventario ni sobre tu nómina.
  3. ¿Quién revisa la salida antes de que llegue a mi operación? Es la pregunta cara. La evidencia de esta semana —una empresa que revisa código para vivir midiendo menos hallazgos y cuatro veces más ruido que su propia línea base— no convierte al modelo en malo; sí deja claro que el paso de revisión humana sigue sin ser opcional.
  4. ¿En qué cambia mi factura? Si la respuesta incluye "es más barato", pregunta contra qué. Ya viste que la comparación depende del punto de partida.

Y una quinta que es en realidad para ti, no para el proveedor: ¿qué pasa en tu negocio el día que una de estas herramientas se equivoque? Si el error se detecta en una hora y se corrige sin que nadie afuera se entere, adelante. Si el error viaja a un cliente, a tu contabilidad o a una declaración, ya sabes en qué parte del proceso tiene que haber una persona.

¿Y si tú eres quien construye agentes?

Un apartado corto para quien tiene equipo técnico, porque hay cambios que sí importan y no salieron en la cobertura.

El más útil, y gratis: la documentación oficial pide quitar las instrucciones heredadas de "incluye un paso final de verificación" o "usa un subagente para verificar", porque el modelo nuevo ya verifica su trabajo por su cuenta y esas líneas provocan sobre-verificación — tokens quemados sin ganancia. Si tu equipo arrastra prompts escritos para modelos anteriores, ahí hay ahorro sin tocar nada más.

Los otros tres, también de la documentación oficial: ahora se pueden cambiar las herramientas a media conversación sin invalidar el caché de mensajes (en beta), lo cual pesa si corres agentes largos donde reconstruir el caché se paga en dinero; el parámetro de respaldos estrena un modo por defecto que redirige una petición marcada por un clasificador en lugar de devolver un error, que es la diferencia entre un proceso que sigue corriendo y uno que amaneció caído; y el mínimo para cachear un prompt bajó a la mitad, así que prompts que antes eran demasiado cortos para caché ahora sí entran.

Dos advertencias del mismo documento, porque migrar a ciegas cuesta: el razonamiento viene activado por defecto —revisa tu límite de tokens de salida, que ahora incluye el pensamiento— y desactivarlo en los niveles de esfuerzo más altos ya devuelve error. Eso último rompe compatibilidad con lo que tengas escrito.

Lo único que sí podemos afirmar

Que salió un modelo nuevo, que cuesta la mitad que el tope de su casa, y que dos evaluadores serios con metodología a la vista lo encontraron empatado con el modelo al que supuestamente le ganó: uno en ingeniería de software, el otro en su índice general de inteligencia.

Que la prueba más citada del gremio todavía no lo mide con arnés neutral.

Y que lo decisivo no es cuál modelo va adelante esta semana, sino qué tan lejos está la pista de pruebas de tu calle. Tu empresa no opera en la pista; y el proveedor que te presuma el número sin decirte en qué condiciones se midió te está enseñando la foto del coche, no las llaves.

Antes de aprobar un cambio de precio, de alcance o de tiempos justificado con el anuncio de esta semana, haz las cuatro preguntas de arriba y guarda las respuestas. Si quieres que revisemos contigo lo que te contestaron, para eso estamos: formulario de contacto o WhatsApp. Nosotros no vendemos modelos de IA — construimos software y ordenamos procesos, y para eso conviene que entiendas qué te están cobrando.

Preguntas frecuentes

¿Claude Opus 5 le gana a Claude Fable 5 en programación?

Depende de quién mida. Anthropic afirma que su modelo nuevo es el estado del arte en evaluaciones de código. Epoch AI, que los corre por su cuenta, los deja empatados en ingeniería de software y coloca a Fable 5 arriba en el índice general de capacidades. Artificial Analysis los pone en empate técnico de inteligencia general, con ventaja clara de Opus 5 en tareas agénticas largas. La lectura defendible con lo publicado al 26 de julio de 2026 es que empatan en código y el nuevo cuesta la mitad.

¿Por qué los números de Anthropic no coinciden con los de los evaluadores independientes?

Porque un modelo se evalúa dentro de un andamiaje —el programa que le da herramientas, le permite reintentar y decide cuándo parar— y ese andamiaje cambia el resultado. Un análisis de junio de 2026 atribuye a esa sola variable diferencias de hasta 10 a 20 puntos en la misma prueba, con el mismo modelo. Además, en el agregador que ese análisis revisó, 99 de cada 100 puntajes los había reportado la propia empresa que entrenó el modelo. Por eso dos cifras de "la misma prueba" pueden no ser comparables entre sí.

¿Es cierto que ahora cuesta la mitad?

Contra el modelo tope de la misma casa, sí: la tarifa por token es la mitad (tabla de precios arriba). Pero el costo real se mide por tarea completada, no por token, y ahí el modelo nuevo promedia más que el modelo intermedio de la misma familia y más que su propio antecesor, según Artificial Analysis. Si venías del modelo tope, ahorras; si venías de uno más económico, gastas más. El modo rápido, además, cobra el doble del precio base.

¿Puedo dejar que la IA revise el código sin que lo vea un humano?

Con la evidencia de estos días, no es sostenible prometerlo. CodeRabbit —una empresa cuyo negocio es revisar código— midió que el modelo nuevo, en su configuración de máximo esfuerzo, detectó menos errores conocidos que la línea base que ya tenía en producción, y generó cuatro veces más comentarios de bajo valor (las cifras exactas están en la tabla de resultados). Sirve como segundo revisor orientado a precisión, y alguien tiene que filtrar lo que produce.

¿Qué le pregunto a mi proveedor cuando me diga que ya usa el último modelo?

Cuatro cosas: quién midió el número que te está citando, en qué se parece esa prueba al trabajo de tu empresa, quién revisa la salida antes de que toque tu operación, y contra qué punto de partida se compara el ahorro que te promete. Si las cuatro respuestas son claras, estás frente a alguien que sabe lo que hace.

¿En Kynoz usan estas herramientas?

Sí, a diario, para construir el software de nuestros clientes y pagando esas facturas nosotros. Por eso este artículo no recomienda un modelo: no conocemos tu operación ni lo que te cuesta a ti un error. Lo que sí hacemos es leer las fuentes originales antes de repetir un titular, y eso es exactamente lo que se lleva quien nos contrata.