用于人类水平预测的推理与工具
机器学习
2024-11-04 v2 人工智能
计算与语言
信息检索
摘要
在网页规模数据集上训练的语言模型之所以在很大程度上成功,是因为它们能够记忆大量训练数据,即使这些数据仅出现在少数示例中。这些能力在问答等任务的评估中通常是可取的,但引发了关于这些模型是否能展示真正推理能力,还是仅仅成功模仿训练数据模式的问题。这种区别在预测任务中尤为突出,因为答案不在训练数据中,模型必须进行推理以做出逻辑推断。我们提出了用于预测的推理与工具框架,这是一个推理与行动代理框架,能够动态检索更新信息并使用配备的工具运行数值模拟。我们使用来自竞争性预测平台的问题评估我们的模型,并证明我们的方法与人类预测相比具有竞争力,甚至可以超越人类预测。这表明,配备适当工具的语言模型确实可以像人类一样思考和适应,为现实世界的决策提供了宝贵的见解。
引用
@article{arxiv.2408.12036,
title = {Reasoning and Tools for Human-Level Forecasting},
author = {Elvis Hsieh and Preston Fu and Jonathan Chen},
journal= {arXiv preprint arXiv:2408.12036},
year = {2024}
}