La primera entrega de RSO-F a ForecastBench se ha situado por encima de las configuraciones evaluadas de GPT-5.5 de OpenAI, Claude Opus 5 de Anthropic y Grok 4.20 de xAI en la clasificación preliminar de datos.

La entrada figura como RSO-F-ST. Presentamos sus predicciones en la ronda de agosto de 2026. La instantánea de septiembre recoge 241 preguntas de datos resueltas del horizonte de siete días de esa entrega.

Qué abarca el resultado

La clasificación preliminar de ForecastBench puntúa las preguntas de datos ya resueltas. Ofrece una visión temprana del rendimiento antes de que un modelo cumpla los requisitos de la clasificación principal del torneo, que también incluye preguntas de mercados.

La comparación utiliza una puntuación ajustada por dificultad. Las entradas pueden abarcar preguntas e historiales de entregas distintos, por lo que los sistemas citados no se han evaluado todos sobre el mismo conjunto de siete días. Nuestros resultados a siete días determinan la posición actual de RSO-F-ST en esa clasificación preliminar más amplia.

Predecir a más largo plazo

Los resultados a treinta días pondrán a prueba a RSO-F en un horizonte más largo. Esperamos que el rendimiento descienda respecto a este primer resultado. La próxima evaluación mostrará hasta qué punto se sostienen las predicciones del modelo a medida que se desarrollan los acontecimientos.

Publicaremos esos resultados y seguiremos probando RSO-F en futuras rondas para mejorar el modelo. Nuestro objetivo es ayudar a las personas a anticipar acontecimientos reales y tomar mejores decisiones.

Explorar RSO-F

Del archivo. La fecha corresponde al periodo descrito.

Clasificación preliminar de ForecastBench

Instantánea de la clasificación, septiembre de 2026

Cómo funciona ForecastBench