RSO-FのForecastBenchへの初回提出は、暫定データセットランキングで、OpenAIのGPT-5.5、AnthropicのClaude Opus 5、xAIのGrok 4.20の評価対象構成を上回りました。

登録名はRSO-F-STです。2026年8月の回に予測を提出しました。9月のスナップショットには、この提出の7日先予測にあたる、結果が確定した241件のデータセット問題が含まれています。

今回の結果の範囲

ForecastBenchの暫定ランキングは、結果が確定したデータセット問題を採点します。市場の問題も含む本大会のランキングに参加資格を得る前に、性能の初期評価を確認できます。

比較には難易度調整済みのスコアが使われます。各登録の問題や提出履歴は異なるため、挙げたシステムすべてが同じ7日先の問題セットで評価されたわけではありません。RSO-F-STの現在の順位は、より広い暫定ランキングの中で、この7日先の結果に基づいています。

さらに先を予測する

30日先の結果では、より長い期間にわたるRSO-Fの予測を検証します。今回の初期結果より性能は下がると見込んでいます。次の評価では、事態が進む中でモデルの予測がどこまで確かだったかを確認します。

結果は公表し、今後の回でもRSO-Fの検証を続け、モデルの改善に役立てます。現実の出来事を見通し、よりよい判断ができるようにすることが、私たちの目標です。

RSO-Fについて

アーカイブ記事。日付は本文で扱う時期を示しています。

ForecastBench暫定ランキング

ランキングのスナップショット、2026年9月

ForecastBenchの仕組み