RSO-F 首次提交至 ForecastBench 的预测,在初步数据集排行榜上,排名高于 OpenAI 的 GPT-5.5、Anthropic 的 Claude Opus 5 及 xAI 的 Grok 4.20 的受评测配置。
该参赛条目以 RSO-F-ST 的名称列出。我们在 2026 年 8 月的轮次中提交了预测。9 月的排行榜快照涵盖了此次提交中七天期限内已判定结果的 241 个数据集问题。
结果涵盖的范围
ForecastBench 的初步排行榜对结果已确定的数据集问题进行评分。在模型获得主赛事排行榜资格之前,它提供了早期的性能视角;主赛事排行榜还包括市场问题。
比较采用了经过难度调整的分数。各条目可能涵盖不同的问题与提交历史,因此上述系统并非都在相同的七天期问题集上接受评估。我们的七天期结果,是 RSO-F-ST 当前在这一更广泛初步排行榜上排名的依据。
预测更远的未来
三十天期结果将检验 RSO-F 在更长预测期限上的表现。我们预计性能会较此次早期结果有所下降。下一次评测将揭示,随着事件发展,模型的预测能在多大程度上保持可靠。
我们将公布这些结果,并在后续轮次中继续测试 RSO-F,用评测结果改进模型。我们的目标是帮助人们预判现实世界中的事件,做出更好的决策。

