(434) 236-9027
IAClaudeHerramientas de desarrollo

Claude Fable 5 ya está aquí: cómo evalúo un nuevo modelo de IA antes de usarlo con clientes

Por Greg8 min de lectura
En resumen

El 9 de junio de 2026, Anthropic lanzó Claude Fable 5, el primer modelo de acceso público de su nivel más potente. Yo ejecuto trabajo de SEO y automatización de clientes sobre Claude, así que un nuevo modelo de primer nivel me importa. Pero no meto un modelo recién salido en la canalización de producción de un cliente que paga. Lo ejecuto en paralelo frente a mi configuración actual sobre tareas cuya respuesta correcta ya conozco, y luego decido. Esta publicación explica qué cambió y exactamente cómo lo pruebo antes de que toque tu proyecto.

Actualización del 10 de junio de 2026

Un día después del lanzamiento ya están los números independientes, y respaldan la afirmación. Artificial Analysis sitúa a Fable 5 primero en su Intelligence Index con 64.9, unos 5 puntos por delante del modelo no Anthropic más cercano, y obtuvo un 53% en Humanity's Last Exam. Me alegra verlo. No cambia nada del proceso de abajo. El benchmark de otro sigue siendo motivo para correr mi propia prueba de respuesta conocida, no para saltármela. (fuente)

Actualización del 13 de junio de 2026

La evaluación quedó interrumpida por algo que no preví. El 12 de junio, el gobierno de EE. UU. ordenó a Anthropic suspender el acceso a Fable 5 y a Mythos 5 para todos los ciudadanos extranjeros, dentro o fuera del país, alegando seguridad nacional. Anthropic no pudo aislar limpiamente a ese grupo, así que deshabilitó ambos modelos para todos los clientes del mundo, manteniendo en línea sus demás modelos. El detonante declarado fue un jailbreak limitado y no universal de Fable 5. Anthropic cumplió, pero dijo públicamente que no estaba de acuerdo con retirar un modelo usado por cientos de millones de personas por un único hallazgo acotado. Esto refuerza todo lo de abajo: la disponibilidad de un modelo ahora es una variable regulatoria, no solo de calidad. El modelo exacto que estaba probando desapareció por una carta del gobierno, y el trabajo de mis clientes no se detuvo, precisamente porque nada se había migrado a él y mi stack actual con Opus 4.8 siguió funcionando. (comunicado de Anthropic, Bloomberg)

Actualización del 18 de junio de 2026

Seis días después del cierre, la primera señal de que podría ser temporal. En una rueda de prensa en Seúl, el director general internacional de Anthropic, Chris Ciauri, dijo que la empresa está "muy segura de que en los próximos días los modelos volverán a estar disponibles". El bloqueo se remonta a una directiva de la Casa Blanca que prohíbe a los ciudadanos extranjeros el acceso a Fable 5 y Mythos, presuntamente activada después de que una empresa de telecomunicaciones coreana con acceso a Mythos quedara bajo escrutinio por supuestos vínculos con China. Anthropic sigue en desacuerdo con la medida y sostiene que un jailbreak potencial y acotado no es razón para retirar un modelo comercial usado por cientos de millones de personas. Para mis fines la lección es la misma en cualquier caso: un gobierno puede revocar o restaurar el acceso en poco tiempo, así que nada de cara al cliente depende de que un solo modelo siga en línea. (Korea JoongAng Daily)

Les digo a mis clientes que las herramientas que ejecutan su trabajo están al día, no obsoletas. No es una frase de marketing. Es un hábito, porque la diferencia entre un modelo de hace dos años y uno actual se nota directamente en la calidad del código que escribo, en las auditorías que ejecuto y en cuánto del trabajo aburrido puedo automatizar con seguridad.

Así que cuando Anthropic lanzó hoy un nuevo modelo insignia, presté atención. Aquí va la versión honesta: qué es realmente el lanzamiento y el proceso que uso antes de confiarle algo que lleve tu nombre.

Qué lanzó Anthropic realmente

El 9 de junio de 2026, Anthropic lanzó Claude Fable 5, que describe como su primer modelo de acceso público del nivel más potente, el nivel que llama Mythos. Hasta ahora, ese nivel de capacidad no estaba disponible de forma general.

Algunas cosas del anuncio que creo que importan para el trabajo real, más que para los titulares:

  • Capacidad. Anthropic afirma que Fable 5 es lo más avanzado en casi todos sus pruebas de referencia, con las mayores mejoras en ingeniería de software, trabajo de conocimiento, visión por computadora e investigación científica. La parte de ingeniería de software es la que más me importa, porque es donde toca las construcciones de clientes.
  • Dos modelos, no uno. El público recibió Fable 5. Anthropic también anunció Claude Mythos 5, una versión menos restringida que estaba limitada a socios verificados dentro de un programa que llama Glasswing, más investigadores de biología seleccionados. Así que casi nadie que lea esto llegó a tener Mythos 5, y esa distinción importaba cuando veías el nombre dando vueltas en internet. Desde el 12 de junio el punto es irrelevante de todos modos: el gobierno de EE. UU. ordenó suspender el acceso a ambos modelos y Anthropic los retiró para todos (ver la actualización al inicio).
  • Salvaguardas con respaldo. Fable 5 incluye protecciones: los mensajes que tocan temas restringidos de ciberseguridad y biología se enrutan a una respuesta de respaldo del modelo anterior, Claude Opus 4.8, en lugar de ser respondidos por Fable 5. Anthropic dice que ese enrutamiento ocurre, en promedio, en menos del 5% de las sesiones, y que su equipo rojo de ciberseguridad dedicó más de 1.000 horas a intentar burlar las protecciones sin encontrar un solo jailbreak funcional.
  • Precio. Usar cualquiera de los dos modelos a través de la API cuesta 10 dólares por millón de tokens de entrada y 50 dólares por millón de tokens de salida. El precio de salida es el número en torno al cual planifico, y explicaré por qué más abajo.

Para contexto, el modelo que venía usando como mi herramienta diaria dentro de Claude Code era Claude Opus 4.8. Así que el mismo modelo que era mi caballo de batalla principal es ahora el respaldo de seguridad del nuevo. Eso te dice algo sobre el tamaño del salto.

Por qué no adopto el primer día

Un nuevo modelo insignia es emocionante, y la tentación es cambiarlo todo y sentirse moderno. Yo no hago eso, y no querría que un proveedor me lo hiciera a mí.

Un modelo que puntúa más alto en pruebas de referencia públicas no es automáticamente mejor en tu trabajo concreto. Las pruebas de referencia miden capacidad general. No miden lo bien que un modelo maneja tu código base, tu voz de contenido, tu esquema o las particularidades de las plataformas donde implemento. La única forma de saberlo es probarlo en trabajo donde ya sé qué aspecto tiene lo correcto.

Así que mi regla es sencilla: un modelo recién salido no entra directo a la canalización de producción de un cliente. Se gana el puesto.

La prueba en paralelo que ejecuto de verdad

Este es el proceso, el mismo que he usado a través de varias actualizaciones de modelo:

  1. Elijo tareas de respuesta conocida. Reúno un puñado de trabajos cuya salida correcta ya conozco: un error que ya arreglé, una auditoría que ya verifiqué, una página que ya publiqué. La hoja de respuestas existe, así que puedo calificar con honestidad.
  2. Ejecuto el viejo y el nuevo en paralelo. Apunto el nuevo modelo y mi configuración actual de Opus 4.8 a las mismas tareas, con los mismos mensajes y el mismo contexto. Sin elegir el mensaje a propósito para que el nuevo quede bien.
  3. Califico por lo que paga. Para mi trabajo eso significa precisión de código, si sigue los patrones existentes del proyecto y cuánto tiempo puede ejecutar una tarea autónoma sin desviarse. No puntuaciones de pruebas de referencia. El trabajo.
  4. Vigilo el coste. A 50 dólares por millón de tokens de salida, dónde apunto el modelo es una decisión de presupuesto, no solo de calidad.
  5. Asciendo de forma selectiva. Si gana con claridad en razonamiento difícil y código, se convierte en mi opción por defecto para esos trabajos. El grueso del trabajo repetitivo se queda en modelos más baratos y locales. No uso el modelo más caro para todo solo porque existe.

Una puntuación más alta en pruebas de referencia es una razón para probar un modelo, no para confiar en él. La única evidencia que cuenta es cómo rinde en trabajo donde ya sé cuál es la respuesta correcta.

Ese último punto sobre la disciplina de costes es el mismo principio que sigo en toda mi pila. El modelo más nuevo y capaz va sobre el razonamiento difícil y el código. Los modelos más baratos y locales manejan el borrador masivo. He escrito antes sobre ese enfoque multimodelo y cómo lo conecto con servidores MCP en producción, y sobre cómo uso Claude Code para trabajo empresarial real en lugar de como un juguete de chat.

Por qué el respaldo es una ventaja para el trabajo de clientes

La parte del anuncio que otros podrían pasar por alto es la que de verdad me gusta para los proyectos de clientes: la salvaguarda que enruta los temas restringidos a una respuesta de Opus 4.8 en lugar de negarse en seco o intentar algo arriesgado.

Cuando construyo automatización que se ejecuta en parte sin supervisión, el comportamiento predecible le gana a la capacidad bruta. Un modelo que tiene una ruta definida y segura para los casos límite es más fácil de confiar en una canalización que uno que se niega en seco y rompe el flujo de trabajo, o que improvisa en una dirección que no autoricé. Para el tipo de trabajo de automatización que construyo para clientes, esa previsibilidad vale más que un punto en una prueba de referencia.

Qué significa esto para tu proyecto

En la práctica, nada cambia para tu trabajo esta semana, y es a propósito. Fable 5 pasa primero por la prueba en paralelo. Si se gana la actualización, se convierte en silencio en el modelo que hace las partes difíciles de tu construcción, y obtienes una salida mejor y más segura sin tener que pensar nunca en nombres de modelos.

La razón por la que escribo publicaciones como esta es la misma por la que ejecuto la prueba: para que veas que estar al día es un proceso deliberado aquí, no un reflejo ni un truco de venta. El objetivo de ejecutar el modelo más nuevo es un mejor trabajo para ti. Nunca es novedad por la novedad.

Si quieres la versión larga de cómo encaja toda mi pila de investigación a implementación, lo desglosé en mi publicación sobre mi flujo de trabajo con Claude, Obsidian y NotebookLM.

En resumen

Claude Fable 5 es un paso adelante real, y me alegra tenerlo. Pero el valor para ti no es que ejecute el modelo más nuevo. Es que pruebo cada modelo nuevo en trabajo de respuesta conocida antes de que toque tu proyecto, apunto la capacidad cara solo donde se gana su coste y mantengo un respaldo seguro en el circuito. Herramientas actuales, aplicadas con disciplina. Ese es todo el trabajo.

Mr. Botsworth

Mr. Botsworth

Hey! I'm Mr. Botsworth, Greg's search bot. Ask me about his projects, skills, or services.