我们正在开发 RSO-F,用于预测现实事件。模型估计某件事在特定时间内发生的概率,涵盖客户需求、经济变化和国际局势等领域。
概率让人们能够在结果揭晓之前表达预期。它可以与其他估计比较,随着信息变化重新审视,也可以在事件结束后接受评估。我们正在开发 RSO-F,让这些估计在不同领域与时间跨度中发挥作用。
明确问题
预测始于一个足够明确、能够回答的问题。预期需求会上升,就需要规定时间段和比较基准。预测某种中断,就需要说明什么情况算作中断,以及何时核查结果。
设想一家企业正在为订单的季节性增长做准备。订单是否会超出现有产能,与销售额是否会增长,是两个不同的问题。它们都与需求有关,却可能导向不同的运营决策。预测必须对应企业需要解决的具体问题。
衡量准确性
我们正在 ForecastBench 上评估 RSO-F,预测须在事件结果揭晓前提交。随着结果确定,这些预测便可以获得评分,并与其他模型比较。这让我们能够考察答案尚不确定时作出的估计。
我们关注模型在不同问题和时间跨度上的表现,也关注校准。校准考察的是:在足够多的预测中,被赋予某一概率的事件,是否确实以相近频率发生。它帮助我们在考察模型区分高概率与低概率结果的能力之外,也审视模型给出的置信程度。
结果需要放在背景中理解。覆盖的领域、评估的时段以及已经确定结果的问题,都会影响比较能够说明什么。我们会随结果一同公布这些细节及相关对比。评估范围之外的应用,则需要与其具体用途相适应的证据。
使用预测
预测与决策的成本和后果共同构成判断依据。在产能的例子中,一家企业可能临时就能承接额外订单,另一家却可能需要提前很久决定采购设备。同一个估计可以支持不同的选择,因为企业面对的约束不同。
我们正在开发 RSO-F 的 API 接入,让预测能够出现在人们作出这些选择的产品中。潜在应用包括规划工具和金融分析,用户可以将估计与具体决策所需的信息放在一起考虑。
使用预测结果
我们的界面工作关注人们获得估计之后可以如何使用它。动态文档可以将预测带入计算,展示改变假设会怎样影响结果。对话界面可以帮助人们考察替代方案,或明确自己想问的问题。
我们正在与模型同步开发这些界面。对于规划决策,一个有用的视图可以包括预测、已有产能及调整产能的成本。让这些关系保持可见,人们便可以在作出承诺之前审视选择的依据。
历史回顾。日期对应文中所述的时期。

