Publicado el 2 de septiembre de 2026 por Sergio Jiménez Mazure en Inteligencia Artificial.
Claude Fable 5.1: el modelo que por fin hace rentable el código agente
Sergio Jiménez
2 de septiembre de 2026
Hoy Anthropic ha lanzado Claude Fable 5.1 y Claude Mythos 5.1. Son el mismo modelo, pero con diferentes niveles de salvaguardas: Fable es la versión disponible para todos, y Mythos está reservado para profesionales de ciberseguridad y ciencias de la vida a través de programas de acceso verificado.
Lo que más me llama la atención de este anuncio no son los benchmarks, aunque son impresionantes. Lo que cambia la ecuación es el precio.
Fable 5.1 cuesta un 25% menos que Fable 5 en cargas de trabajo típicas, y hasta un 45% menos en tareas agente pesadas. Las lecturas de caché ahora cuestan un 75% menos, pasando de $1 a $0.25 por millón de tokens. Para cualquiera que ejecute agentes que reutilizan contexto, que es básicamente todos los agentes que funcionan bien, esto supone una rebaja real en la factura.
La razón es sencilla. Los agentes que trabajan con el mismo contexto durante varias interacciones hacen muchas lecturas de caché. Cada vez que el modelo relee algo que ya procesó antes, cuesta una cuarta parte de lo que costaba con Fable 5. En un workflow agente típico, las lecturas de caché representan la mayor parte del costo total. Reducirlas a la cuarta parte no es una rebaja marginal, es un cambio de categoría.
Y los benchmarks lo respaldan. No estamos hablando de mejoras de cinco o diez puntos porcentuales, que ya serían notables. Estamos hablando de saltos que cambian lo que un modelo puede hacer de verdad.
Terminal-Bench-Science 0.1, que mide flujos de trabajo científicos reales con tareas escritas y revisadas por científicos de Stanford de distintas disciplinas, salta de 24.7% a 52.6%. Se duplica. Esto no es un benchmark de trivia: son 70 tareas que implican leer papers, correr computaciones y sacar conclusiones. Terminal-Bench 4.0 en coding pasa de 42.0% a 55.8%. CursorBench 3.2.0, que evalúa rendimiento de coding integrado en IDEs reales, alcanza 73.4%, el más alto registrado. Humanity's Last Exam llega al 65% con herramientas, superando a GPT-5.6 Sol y a Opus 5. ProofBench v1.1, que mide demostraciones matemáticas formales, consigue un 100% perfecto, el primero de cualquier modelo frontier.
Tabla comparativa de benchmarks:
Terminal-Bench-Science 0.1: Fable 5 = 24.7%, Fable 5.1 = 52.6%, Opus 5 = 29.0%, GPT-5.6 Sol = 22.4%
Terminal-Bench 4.0: Fable 5 = 42.0%, Fable 5.1 = 55.8%, Mythos 5.1 = 60.9%, Opus 5 = 52.3%
Humanity's Last Exam (con herramientas): Fable 5.1 = 65.0%, Opus 5 = 63.6%, Fable 5 = 63.8%
CursorBench 3.2.0: Fable 5.1 = 73.4%, Fable 5 = 70.5%, Opus 5 = 70.0%
SWE-bench Pro: Fable 5.1 = 81.2%, Fable 5 = 80.0%, Opus 5 = 79.2%
SWE-bench Verified: Fable 5.1 = 95.0%
ProofBench v1.1 (demostración matemática formal): Fable 5.1 = 100%
GPQA Diamond (ciencia a nivel de posgrado): Fable 5.1 = 92.6%
AutomationBench (automatización agente multi-paso): Fable 5 = 17.1%, Fable 5.1 = 31.4%, Opus 5 = 26.9%
Pero lo que me parece más relevante es lo que no se mide en benchmarks: la capacidad de trabajar durante horas sin perder el hilo. Esto no es una mejora incremental sobre la versión anterior. Es una dinámica de trabajo completamente nueva.
Lo que significan las ejecuciones prolongadas en la práctica
Un ingeniero de MongoDB, Ron Sanzone, contó que Fable 5.1 construyó un prototipo complejo en tres días. Hizo una investigación inicial en todo el código y la documentación de servicios para producir un diseño novedoso y extensible. Después corrió durante horas sin supervisión, con bucles de verificación robustos, para implementar el prototipo completo. Se despertaba por la mañana con la siguiente fase terminada y un walkthrough visual de lo que había construido, con evidencia clara de su éxito.
En Ramp, Dwight Temple, ingeniero senior de machine learning, probó un run de 38 horas sin supervisión en un problema de ML. Diagnosticó un error de etiquetado en un resultado anterior, lo corrigió, lanzó seis experimentos paralelos que corrieron durante la noche y devolvió resultados con los próximos pasos. Pero fue el segundo experimento el que más le impresionó: le dio una tarea abierta de encontrar el problema de mayor impacto que nadie estuviera tratando, y el modelo identificó una alerta no atendida vinculada a un outage en producción, extrajo los logs y prescribió la corrección.
En la firma de inversiones Millennium, Damien, un portfolio manager senior, contó que tenían un crash extremadamente raro en su sistema interno, aproximadamente una vez cada un millón de ejecutaciones, que ningún ingeniero había podido explicar en cuatro o cinco años. Todos los modelos que habían probado, incluido Fable 5, lo habían pasado por alto. Fable 5.1 fue el primero en encontrarlo: desensambló una biblioteca externa, la comparó con el core dump y rastreó el crash hasta un bug en esa biblioteca. El tiempo que habría llevado conductar ese análisis es difícil de justificar, dijeron.
Estos tres ejemplos comparten algo: tareas que requieren mantener contexto, razonamiento y calidad durante ejecuciones de horas o días. Eso no existía en la generación anterior. Fable 5 podía hacer cosas impresionantes en sesiones cortas, pero perdía la forma cuando las sesiones se extendían. Fable 5.1 no solo resuelve más, resuelve mejor durante más tiempo.
Shopify confirmó que Fable 5.1 es más cómodo con trabajo prolongado y sin supervisión: mantiene sus propios registros, reprioriza cuando las cosas cambian y retoma donde lo dejó. Para los que estamos construyendo agentes que necesitan ejecutar tareas complejas durante horas, eso es exactamente lo que faltaba.
Los números detrás del ahorro
Para poner los costos en perspectiva, los precios base de Fable 5.1 son los mismos que Fable 5: $10 por millón de tokens de entrada y $50 por millón de tokens de salida. La diferencia está enteramente en las lecturas de caché, que pasan de $1 a $0.25 por millón de tokens. Anthropic publicó dos gráficos comparativos que muestran por qué esto importa tanto.
En una carga de trabajo típica, que cubre el uso en Claude Enterprise, Claude Code y la API, el costo indexado baja de 100 a 75, una reducción del 25%. Pero en una carga de trabajo agente pesada, donde las lecturas de caché representan la mayor parte del costo porque el modelo relee contexto constantemente, el costo indexado baja de 100 a 55. Casi la mitad.
Para los que estamos usando Claude para ejecutar agentes en producción, esto cambia lo que merece la pena automatizar. Un workflow que antes costaba $200 por ejecución ahora cuesta $110. Si lo ejecutas diez veces al día, pasas de $2,000 a $1,100 al mes. Y esos números son para tareas agente pesadas, que son precisamente las más interesantes.
Dan Shipper, CEO de Every, lo resumió de la mejor manera posible:
"Es la inteligencia de Fable, el precio de Opus, y la velocidad de Sonnet. En nuestras pruebas fue aproximadamente el doble de rápido que Opus 5 y usó la mitad de tokens."
Cognition, la empresa detrás de Devin, se llevó a Fable 5.1 en el día de lanzamiento: pasaron todo su tráfico de Opus 5 a Fable 5.1. En sus pruebas coincidió o superó a Fable 5 en cada tarea, a menor costo por tarea, y con la nueva política de precios de caché, un modelo de clase Fable por fin es económico para los flujos de trabajo que mantenían en Opus, empezando por code review.
Los resultados científicos son lo que realmente impresiona
Anthropic dedicó una sección entera de su publicación a capacidades de investigación, y con razón. Los números en esta área son los que sugieren un salto cualitativo, no solo cuantitativo.
En diseño de proteínas, Mythos 5.1 diseñó binders de alta afinidad con tasas de éxito del 50%, frente al 10-15% habitual en el sector. La afinidad de unión fue 10 veces mayor que los mejores diseños presentados a las competiciones de Adaptyv Bio. Los objetivos incluyeron EGFR, Nipah G y 15-PGDH, todos confirmados experimentalmente en laboratorio por organizaciones externas. Para poner esto en contexto, el diseño de proteínas de alta afinidad es el primer paso en el desarrollo de muchos medicamentos. Un hit rate del 50% en 12 objetivos distintos es un salto enorme respecto a lo que se consideraba posible.
También creó un mapa de elevación de alta resolución de un tercio de Venus a partir de imágenes de radar de la misión Magellan de NASA, con datos de hace más de 30 años. La resolución pasó de 10-20 km a 2-3 km, y las alturas se miden con un 25% más de precisión que antes. El mapa se ha publicado bajo licencia Creative Commons en Zenodo, en previsión de las próximas misiones VERITAS de NASA y EnVision de ESA, para que puedan decidir qué features geológicos observar.
En biología computacional, Mythos 5.1 escribió kernels GPU personalizados que aceleraron siete modelos de deep learning entre 1.4 y 2.5 veces con outputs idénticos. ChromBPNet se aceleró 1.6 veces, Enformer 1.4 veces, ProGen2 2.5 veces. Los ahorros estimados en análisis genómicos completos van del 30 al 60% en costos de GPU. Para un análisis de mutaciones en 20,000 genes con Enformer, el costo estimado bajó de $30,000 a $21,000. Con Flashzoi, de $14,000 a $7,000. Ese tipo de optimización normalmente llevaría semanas a un equipo de ingeniería de rendimiento y suele ser inaccesible para laboratorios académicos. Anthropic planea publicar estas optimizaciones como open source.
Rakuten Medical contó que le pidió a Fable 5.1 revisar un proyecto de investigación clínica que tres modelos frontier anteriores habían aprobado. Encontró un vacío que ninguno de ellos había visto e insistió en investigarlo más. Después propuso una hipótesis completamente nueva, convirtiendo un dataset que habían descartado en una nueva dirección de investigación en una sola tarde. Es la primera vez, dijeron, que un modelo frontier les ha permitido explorar nueva investigación de esta manera.
iGent, una empresa de investigación, contó que en un problema de gran desafío que habían usado como banco de pruebas durante 18 meses, Fable 5.1 logró un progreso material. Hizo conexiones en el espacio en blanco que no habían visto en otro modelo, y optimizó un kernel de computación que Fable 5 ya había agotado en un 35% adicional.
Seguridad, salvaguardas y lo que cambia para los que usamos Claude en producción
Las salvaguardas de ciberseguridad ahora generan un 60% menos de falsos positivos. Fable 5.1 puede usarse para descubrir vulnerabilidades de software, aunque no para desarrollar exploits. Esto significa que en Claude Code vas a ver menos intervenciones del sistema por sesión, algo que cualquiera que haya trabajado con las salvaguardas anteriores va a agradecer.
En biología, las consultas benignas de biología elemental y preguntas médicas activan las salvaguardas un 85% menos que con Fable 5. Las tareas de investigación en ciencias de la vida siguen redirigidas a los modelos Opus, pero para uso general la experiencia mejora bastante.
Mythos 5.1, por su parte, ha demostrado las capacidades de ciberseguridad más fuertes de cualquier modelo que Anthropic haya liberado. El Cyber Verification Program (CVP) ya existía para Opus y Sonnet, y ahora incluirá acceso a Mythos. El Life Sciences Verification Program (LSVP) es nuevo, está en colaboración con el gobierno de EE.UU., y ofrece acceso a Mythos con salvaguardas diseñadas para investigación profesional. Actualmente solo está disponible para organizaciones estadounidenses, aunque Anthropic está coordinando la expansión a socios internacionales.
Un dato que me parece importante para el ecosistema: Anthropic ha implementado mecanismos anti-dilutión más fuertes. Las nuevas cuentas de API ya no pueden editar el contexto previo de Claude en conversaciones multi-turn mientras preservan la transcripción del thinking anterior. Esto cierra una técnica de dilutión documentada públicamente y que se usaba industrialmente con miles de cuentas falsas para extraer capacidades del modelo. Los clientes existentes no se ven afectados por ahora, pero con los próximos releases sí se aplicará a todos.
Para los equipos que trabajan con datos sensibles, Enterprise Frontier Safeguards permite cero retención de datos: los clientes almacenan sus datos en su propia infraestructura cloud, no en los sistemas de Anthropic. La revisión humana, por defecto, la hace el cliente, no Anthropic. Se implementará por fases a partir del otoño en Claude Code, Claude Enterprise, Amazon Bedrock, Google's Agent Platform y Microsoft Foundry, con colaboración de más de 100 clientes de sectores como finanzas, salud, manufactura, telecomunicaciones, legal, retail y sector público.
Y un detalle normativo: desde el 2 de agosto de 2026, las salidas de Claude incluyen un watermark conforme a la EU AI Act. Es invisible para quien no tenga la API de detección y no afecta a la calidad ni al contenido. La API de detección está disponible en preview privado para reguladores, medios, verificadores de hechos y organizaciones de investigación. Anthropic firmó el Code of Practice on Transparency of AI-Generated Content junto con 190 otras organizaciones.
Qué significa esto en la práctica
Fable 5.1 está disponible hoy en todas las plataformas, incluyendo AWS, Google Cloud y Microsoft Azure. Los desarrolladores pueden empezar con claude-fable-5.1 en la API de Claude.
Para los que estamos usando Claude en producción, la decisión se simplifica. Opus 5 sigue siendo más potente en tareas que requieren razonamiento profundo, pero Fable 5.1 ofrece un ratio capacidad/precio que Opus no puede igualar. Y cuando el esfuerzo se baja a Medium o Low, Fable 5.1 consigue resultados similares o mejores que Fable 5 a un coste mucho menor. Anthropic señaló que Fable 5.1 funciona por defecto con esfuerzo alto en Claude Code, y con esfuerzo medio en Claude Cowork y en Claude.ai.
En Hebbia, la empresa de análisis financiero, Fable 5.1 produjo las mejores presentaciones de PowerPoint de cualquier modelo que han probado, tanto en diseño de slides como en cobertura completa del tema de investigación. En su evaluación de citations tuvo el mejor recall de hechos sobre documentos financieros. En preguntas complejas con múltiples partes, fue el primer modelo que respondió cada una.
El caso de Browserbase es particularmente revelador sobre la fiabilidad. En su benchmark de agente de navegador, Fable 5.1 completó el 82% de las tareas en unos 10 minutos cada una, contra el 74% de Opus 5 y el 57% de Fable 5, usando menos tokens que ambos. Y lo más importante: nunca cruzó un punto de parada crítico en cientos de tareas medidas. En Crosby, su benchmark de contract redlining mejoró de 47.9 a 57.0, con la mayor ganancia en calidad de primera vuelta, que se duplicó.
Solo Glean, la empresa de búsqueda de conocimiento empresarial, dijo que en pruebas a ciegas contra Fable 5, sus jueces prefirieron las respuestas de Fable 5.1 por un margen de 2 a 1 en preguntas de conocimiento cotidiano, investigación de alta intención y borradores. Estos resultados convirtieron a Fable 5.1 en su recomendación principal. Es una señal relevante cuando una empresa de búsqueda de conocimiento empresarial, que necesita precisión factual por encima de todo, cambia su recomendación por un margen tan amplio.
Pero lo que me interesa de verdad no es la lista de empresas que lo han probado. Es que por fin parece viable ejecutar agentes complejos durante horas en un modelo de coste razonable. Eso no era posible hace seis meses. Ahora lo es, y los primeros equipos que lo están usando ya están contando lo que están logrando con ello.
Si estás usando Fable 5 o pensando en migrar a Claude para tareas de coding o agentes, merece la pena probarlo. La diferencia de costos es lo bastante significativa como para que los workflows que antes eran demasiado caros ahora entren en presupuesto. Y la capacidad de ejecución prolongada abre posibilidades que antes simplemente no existían.
Fuente: Anthropic: Introducing Claude Fable 5.1 and Claude Mythos 5.1