Saltar al contenido principal

Anthropic CRI: medir razonamiento conceptual sin ground truth

·9 min read·Ignacio Avilés
compartir:TwitterLinkedIn

Anthropic CRI: medir razonamiento conceptual sin ground truth

El 12 de agosto de 2026, Anthropic y Redwood Research publicaron algo raro: un benchmark que no mide matemática, ni código, ni preguntas con respuesta única. Mide razonamiento conceptual: el tipo de argumentación filosófica y de teoría de decisión que hoy hacen los humanos cuando discuten cómo gobernar una IA más lista que nosotros, qué valores debería tener, o cómo evitar una crisis de cooperación entre laboratorios. Lo agregaron en un número al que llamaron Conceptual Reasoning Index (CRI), y el modelo que mejor rindió — Opus 5 — apenas llegó a 73.6 sobre 100, cuando el techo estimado es ~91. Si trabajás con modelos frontera, como vimos en Claude Opus 5, o seguís la conversación sobre evaluación de capacidades como en OpenAI Astra, este índice es una señal de que todavía no sabemos medir lo que más nos importa.

Por qué este índice cambia la conversación La mayoría de los benchmarks de hoy premian cosas "hill-climbable": problemas donde el progreso es barato de verificar y se puede iterar mil veces. El CRI mide lo contrario: preguntas donde no hay ground truth empírico y la única forma de avanzar es argumentando bien. Justo el tipo de razonamiento que necesita la comunidad de safety para discutir AGI, governance y riesgos existenciales.

Qué mide el CRI y por qué se construyó

El paper de Emery Cooper, Caspar Oesterheld, Chi Nguyen, Alex Kastner, Joe Benton y Ethan Perez arranca con un problema concreto: para reducir los riesgos de una IA avanzada necesitamos modelos que nos ayuden a pensar sobre esos riesgos. Pero la mayoría del training actual depende de datos abundantes y de feedback verificable. Los modelos son buenos para problemas con respuesta clara (sumar, compilar, responder trivia) y flojos para problemas donde no hay forma práctica de verificar la respuesta y hay que apoyarse en argumentación.

Ahí es donde entra el CRI. La idea es ambiciosa: medir "razonamiento conceptual" como capacidad, del mismo modo que medimos coding o matemática. El sitio oficial del benchmark está en conceptualreasoning.ai, y el paper completo se publicó en el Alignment Science Blog de Anthropic.

La hipótesis de fondo Si la automatización del trabajo de safety va a llegar mucho antes que la automatización de las capacidades peligrosas, queremos modelos buenos para safety ahora. Para eso necesitamos saber qué tan buenos son hoy, no en cinco años. Y resulta que todavía no tenemos benchmarks serios para ese tipo de razonamiento.

Los tres benchmarks que componen el CRI

El CRI no es un dataset único. Es un agregado ponderado de tres benchmarks independientes, cada uno atacando un ángulo distinto del razonamiento conceptual. La fórmula actual es 60% LMCA + 20% ACCoRD + 20% DTBench capabilities, pero los autores aclaran que planean rotar y ajustar a medida que algunos se saturen.

LMCA — argumentación conceptual

LMCA (Language Model Conceptual Argumentation) es el componente más grande y el más interesante desde lo técnico. Es un dataset curado de 560 position texts sobre temas como teoría de la decisión, filosofía, riesgos de IA avanzada y policy de alignment, cada uno acompañado de 1.461 argumentos en contra rated por expertos. En total, 2.140 ratings humanas hechas por investigadores conceptuales, con inter-rater agreement alto.

El test no le pregunta al modelo "¿cuál es la respuesta correcta?". Le pide juzgar la calidad de un argumento contra una posición. Es un cambio de eje importante: en vez de buscar el consenso, se evalúa la capacidad de evaluar razonamientos. La mayoría de los modelos probados rindieron muy por debajo del acuerdo entre humanos, lo que sugiere que todavía no internalizaron qué hace bueno a un argumento conceptual.

El detalle metodológico que más me gustó El benchmark incluye una validation set de ~50 argumentos, cada uno rated independientemente por 4–6 personas y discutido durante 7–8 horas en total. Cuando un modelo se acerca al acuerdo humano-medido, ya está rindiendo a nivel de un panel de expertos. Esa es la vara.

ACCoRD — consistencia lógica en temas conceptuales

ACCoRD (Assessment of Consistency in Conceptual Reasoning Domains) ataca otro problema: si le preguntás al mismo modelo la probabilidad de A y después la probabilidad de A&B, ¿te da números consistentes con la regla P(A) ≥ P(A&B)? Suena básico, pero los modelos fallan seguido, sobre todo en temas donde no hay un "ground truth" que los ancle.

El dataset tiene ~14.000 constraints de consistencia generados por modelos, distribuidos en 18 tipos, con un pipeline automático de validación. De esos, 567 fueron revisados a mano y aprobados, y son los únicos que cuentan para el CRI. La intuición es potente: si un modelo es inconsistentemente inconsistent en sus creencias reportadas, no podés fiarte de su razonamiento sobre esos temas.

DTBench capabilities — teoría de la decisión

DTBench capabilities es el más específico: 407 preguntas de opción múltiple diseñadas a mano para medir razonamiento decision-teórico en situaciones donde el modelo tiene que predecir el comportamiento de sí mismo o de copias casi idénticas. La mayoría de las preguntas son originales de Caspar Oesterheld, que viene publicando en decision theory, y fueron validadas independientemente por otro experto del dominio.

Este componente es el más cercano a saturarse: Fable 5 ya pega en el 98% del techo estimado. Es esperable: la teoría de la decisión tiene una estructura formal que se parece más a la matemática tradicional que a la argumentación abierta, y los modelos vienen rindiendo bien ahí hace rato.

Los resultados: Opus 5 lidera, pero nadie llega al techo

Los datos que publicó Anthropic son lo más jugoso del paper. El CRI de Opus 5 es 73.6 (95% CI: ±2.1), el más alto entre los modelos evaluados al 10 de agosto de 2026. Le siguen Fable 5, Muse Spark 1.2 y Gemini 3.6 Flash, con scores bastante más bajos en el aggregate. Y el techo estimado del benchmark es ~91, lo que deja una brecha de casi 18 puntos entre el mejor modelo actual y el máximo teórico posible.

Lo más interesante es la tendencia. Los autores dicen que los scores vienen subiendo de manera aproximadamente lineal desde fines de 2024, sin señales de flattening. Extrapolando, LMCA podría empezar a saturarse en aproximadamente un año. ACCoRD no se sabe cuándo va a saturar. Y DTBench ya casi está, como vimos.

Lo que la tendencia te dice como developer Si tu trabajo depende de que un modelo razone bien sobre política, governance o diseño de sistemas complejos — algo cada vez más común cuando diseñás sistemas multi-agente — el CRI es probablemente el indicador que más te conviene mirar. No porque prediga el futuro, sino porque mide algo que ningún otro benchmark cubre.

Por qué esto importa si no te dedicás a safety

Acá es donde muchos lectores se van a desconectar, y estaría bueno no hacerlo. El CRI no es solo un paper para safety researchers. Cambia tres cosas que te tocan si trabajás con LLMs en producción:

Primero, redefine qué cuenta como "benchmark serio". Si lo que necesitás de un modelo no se reduce a "responder bien preguntas con respuesta única", los benchmarks clásicos (MMLU, GSM8K, HumanEval) te dan una imagen incompleta. El CRI es el primer intento sistemático de medir lo que falta.

Segundo, establece un protocolo reusable. La metodología de LMCA — argumentos rated por expertos, no respuestas correctas — es replicable. Vas a ver aparecer benchmarks similares para razonamiento legal, ético, o de diseño de sistemas. Si te toca construir eval sets para tu producto, mirá este paper antes.

Tercero, da una medida honesta del progreso. El gráfico de tendencia del paper es un antídoto contra el "los modelos ya saturaron todo" que escuchás seguido. Todavía hay dimensiones donde la distancia entre el mejor modelo y el techo es enorme, y la pendiente no se está achatando.

Lo que el CRI todavía no mide (y por qué eso es sano)

Los autores son explícitos en las limitaciones. Por ahora, solo la capacidad de juzgar argumentos entra al CRI, no la capacidad de producir buenos argumentos. Eso es un trade-off consciente: medir generación conceptual es mucho más caro y ruidoso, y la calidad de los argumentos generados es muy difícil de evaluar automáticamente. Planean agregarlo en el futuro.

Tampoco cubre cosas como razonamiento legal aplicado, ethics casuística, o diseño de políticas públicas. Es razonamiento conceptual en temas de safety, no razonamiento conceptual en general. Si tu dominio necesita otro tipo de argumentación, vas a tener que armar tu propio benchmark — y la metodología de este paper es un excelente punto de partida.

Cómo podés usar el CRI hoy

Si querés experimentar vos mismo, hay dos puertas de entrada. La primera es el sitio conceptualreasoning.ai, donde vas a encontrar los scores actualizados por modelo y la metodología detallada. La segunda es el formulario para pedir acceso a LMCA, el dataset principal, que está enlazado en el paper. Con LMCA podés armar tus propios prompts y medir qué tan bien razona tu modelo local sobre los mismos temas que evaluaron Anthropic y Redwood.

El experimento que vale la pena hacer este finde Tomá un modelo de los que ya tenés corriendo localmente — si seguís Ollama o Swiftlet, ya tenés candidatos — y pasale cinco argumentos random de LMCA. Pedile que los ratee del 1 al 7 según el rubric del paper. Después compará tus ratings con las del paper. Te vas a sorprender de dónde caen los modelos de tamaño medio.

El Conceptual Reasoning Index no es el benchmark definitivo. Es el primero que se toma en serio la pregunta de cómo medimos razonamiento en lugares donde la verificación empírica no llega. Y eso, en un campo obsesionado con los números, es un paso que viene faltando hace rato.

comentarios

$ subscribe --newsletter

Recibe los nuevos posts en tu email

Un email cuando publico algo nuevo. Sin ruido, sin relleno.

Sin spam. Baja en cualquier momento. Política de privacidad.