Claude formaliza el Último Teorema de Fermat en Lean: 11 días, 13 millones de líneas

Claude formaliza el Último Teorema de Fermat en Lean: 11 días, 13 millones de líneas

09-09-2026 1:47:43
Compartir:

El 4 de septiembre de 2026 Anthropic publicó un hito inusual: un prototipo avanzado de Claude produjo la primera prueba completa verificada por computadora del Último Teorema de Fermat, escrita en el asistente de pruebas Lean. No es un paper de «parece correcto»: Lean comprueba la lógica paso a paso. En 11 días el modelo escribió del orden de 13 millones de líneas y demostró decenas de miles de teoremas intermedios.

Para equipos de producto, startups de IA y pymes que ya delegan razonamiento a modelos, el mensaje útil no es «la IA ya es Wiles». Es: cuando el volumen de resultados generados supera lo que humanos pueden revisar a mano, la formalización (traducir el argumento a código verificable) se vuelve una capa de confianza. Este artículo resume el anuncio oficial, el andamiaje Prove2Me y qué preguntas hacer antes de hablar de «IA auditable» en su roadmap.

Qué anunció Anthropic el 4 de septiembre

Investigadora latina revisando en laptop el anuncio de Anthropic sobre la formalización de Fermat en Lean
4 sep 2026: Anthropic publica la primera prueba e2e verificada por computadora del Último Teorema de Fermat

Según el post de investigación de Anthropic:

  • Claude trabajó en gran medida de forma autónoma durante 11 días y produjo la primera formalización e2e del Último Teorema de Fermat en Lean.
  • El artefacto ronda ~13 millones de líneas de Lean y del orden de ~29.500 teoremas intermedios usados en la prueba final (Anthropic menciona ~30.300 teoremas demostrados en el camino).
  • La prueba sigue una exposición simplificada del enfoque de Wiles (vía Darmon–Diamond–Taylor); la entrada humana fue sobre todo de alto nivel (prioridad de subobjetivos).
  • Un comparador confirmó que el enunciado formal coincide con el de Mathlib; Lean verificó la prueba usando solo sus tres axiomas estándar.

Kevin Buzzard (Imperial College London), que lidera el esfuerzo comunitario de formalizar FLT, calificó el resultado como un logro extraordinario de autoformalización y un paso hacia herramientas que alivien la carga de los referees y detecten errores en el corpus matemático.

Por qué falló al principio (y qué cambió con Prove2Me)

Ingeniero latino señalando un grafo DAG de teoremas en Prove2Me mientras agentes colaboran
Prove2Me: DAG de teoremas, reuso y compilación Lean para que varios agentes no pierdan el estado

Anthropic es explícita: los primeros intentos multiagente se trabaron. Los agentes perdían el estado del proyecto y dejaban de colaborar bien. El salto llegó al usar Prove2Me, una plataforma abierta de formalización colaborativa (Peng y colaboradores, Columbia), que:

  • mantiene un DAG de enunciados para decidir qué demostrar después;
  • separa enunciados y pruebas para acelerar compilación Lean;
  • guarda descripciones en lenguaje natural para buscar y reutilizar lemas.

Con ese andamiaje y un harness multiagente tipo Claude Code, el equipo cerró la campaña en menos de dos semanas. Anthropic estima del orden de seis mil millones de tokens de salida de un modelo de investigación interno comparable a Claude Fable 5.1. Los intentos fallidos previos aportaron ~7% de las líneas no boilerplate del artefacto final.

Qué implica (y qué no) para equipos que construyen con IA

Matemática negra con trenzas contrastando una prueba en papel con código Lean en pantalla
13 millones de líneas Lean y ~29.500 teoremas intermedios: la verificación, no solo el Elo

Tres lecturas prácticas:

  • Verificación ≠ descubrimiento. Anthropic distingue este trabajo de resultados donde la IA inventa matemáticas nuevas: aquí el valor es comprobar una prueba conocida (Wiles) con la dureza de un asistente formal.
  • El cuello de botella se mueve. Si modelos y humanos generan más «pruebas» o specs de las que el equipo puede auditar, pedirle al mismo stack que formalice o que produzca artefactos chequeables (tests formales, contratos, Lean/propiedad) puede ser más barato que ampliar solo revisión humana.
  • Hace falta orquestación. El anuncio no es «un chat largo». Es DAG, reuso, compilación y agentes que no se pisan. Si su producto multiagente no tiene estado compartido confiable, fallará como fallaron los primeros intentos de FLT.

Checklist breve si vende o compra «IA verificable»:

  • ¿Qué propiedad exacta se verifica (enunciado Mathlib-equivalente, invariante de negocio, política de seguridad)?
  • ¿Quién firma el enunciado formal antes de que el modelo «demuestre»?
  • ¿Hay presupuesto de tokens/cómputo y un plan B cuando el agente se atasca?
  • ¿El artefacto es reproducible (repo, hash, versión del checker)?

Lectura para startups y equipos de producto

Fundadora de startup tech definiendo checklist de auditable AI en un tablero de producto
Para producto: formalización y pruebas como capa de confianza cuando la IA genera más de lo que humanos pueden revisar

No necesita formalizar Fermat. Sí necesita decidir qué partes de su sistema (pagos, permisos, pricing, compliance) merecen una capa más dura que «el LLM dijo que está bien». Empiece por un piloto estrecho: una especificación formal o un conjunto de propiedades con checker automático; midan tasa de aceptación de QA y tiempo hasta artefacto verde. Si necesita aterrizar ese pipeline —producto, landing e integración— en Presticorp trabajamos por etapa: startups, pymes y ecommerce.

La sugerencia del escritor

Trate la formalización de FLT como una señal de infraestructura de confianza, no como marketing de «superinteligencia». Esta semana defina: (1) qué claim de su producto exigiría un checker, (2) quién escribe el enunciado, (3) qué presupuesto de tokens y de revisión humana acepta. Cuando la IA genere más de lo que puede leer, gana quien tenga verificación, no quien tenga el prompt más largo.

Fuentes

  • Anthropic. «Formalizing Fermat's Last Theorem». 4 de septiembre de 2026. Ver anuncio
  • Nature News. «Anthropic AI ‘formalizes’ proof of Fermat’s last theorem in just 11 days». 7 de septiembre de 2026. Ver cobertura
  • Chen, S., Marwaha, K., Lu, X., Yuen, H., & Peng, T. (2026). «Prove2Me: An open collaborative platform for scaling math formalization». arXiv:2608.28433. Ver paper

Nota editorial: cifras de líneas, teoremas, tokens y plazos se citan tal como aparecen en el post de Anthropic del 4 de septiembre de 2026. Lean/Mathlib y el estado del repo público pueden evolucionar; verifique el GitHub enlazado desde el anuncio el día que cite números en un brief comercial.

Compartir:

0 Comentarios

Deja un comentario

Landing pages especializadas

¿Proyecto totalmente personalizado? Contáctanos.

Si tu proyecto requiere una solución más enfocada, entra directo a la landing ideal para tu negocio y envíanos tu información en el formulario correspondiente.