RSO-F 首次提交至 ForecastBench 的预测,在初步数据集排行榜上,排名高于 OpenAI 的 GPT-5.5、Anthropic 的 Claude Opus 5 及 xAI 的 Grok 4.20 的受评测配置。

该参赛条目以 RSO-F-ST 的名称列出。我们在 2026 年 8 月的轮次中提交了预测。9 月的排行榜快照涵盖了此次提交中七天期限内已判定结果的 241 个数据集问题。

结果涵盖的范围

ForecastBench 的初步排行榜对结果已确定的数据集问题进行评分。在模型获得主赛事排行榜资格之前,它提供了早期的性能视角;主赛事排行榜还包括市场问题。

比较采用了经过难度调整的分数。各条目可能涵盖不同的问题与提交历史,因此上述系统并非都在相同的七天期问题集上接受评估。我们的七天期结果,是 RSO-F-ST 当前在这一更广泛初步排行榜上排名的依据。

预测更远的未来

三十天期结果将检验 RSO-F 在更长预测期限上的表现。我们预计性能会较此次早期结果有所下降。下一次评测将揭示,随着事件发展,模型的预测能在多大程度上保持可靠。

我们将公布这些结果,并在后续轮次中继续测试 RSO-F,用评测结果改进模型。我们的目标是帮助人们预判现实世界中的事件,做出更好的决策。

探索 RSO-F

历史回顾。日期对应文中所述的时期。

ForecastBench 初步排行榜

排行榜快照,2026 年 9 月

ForecastBench 的运作方式