MIRAI:评估 LLM 代理用于事件预测的基准
计算与语言
2024-07-02 v1 人工智能
摘要
近期大语言模型(LLM)的进展使 LLM 代理能够自主收集世界信息,进而进行推理以解决复杂问题。鉴于此种能力,越来越多的关注点转向利用 LLM 代理预测国际事件,这些事件可影响决策并塑造政策发展。尽管存在这种日益增长的兴趣,但缺乏对 LLM 代理预测能力和可靠性的严格基准。为填补这一空白,我们引入MIRAI,一个旨在系统评估 LLM 代理作为国际事件预测者能力的新型基准。我们的基准具备一种代理环境,提供访问大型历史结构化事件和文本新闻文章的数据库的工具。我们对GDELT事件数据库进行精细清洗和解析,以构建一系列具有不同预测时序的关系预测任务,评估 LLM 代理从短期到长期预测的能力。我们进一步实现了API,使 LLM 代理可通过基于代码的接口利用不同工具。总之,MIRAI在三个维度全面评估了代理能力:1) 自主从大型全球数据库中来源和集成关键信息;2) 使用领域特定API和库编写代码以进行工具使用;3) 在不同格式和时间上联合推理,以准确预测未来事件。通过全面基准测试,我们旨在建立一个可靠框架,用于评估 LLM 代理在预测国际事件方面的能力,从而推动开发更准确和可信的模型,以进行国际关系分析。
引用
@article{arxiv.2407.01231,
title = {MIRAI: Evaluating LLM Agents for Event Forecasting},
author = {Chenchen Ye and Ziniu Hu and Yihe Deng and Zijie Huang and Mingyu Derek Ma and Yanqiao Zhu and Wei Wang},
journal= {arXiv preprint arXiv:2407.01231},
year = {2024}
}
备注
66 pages, 8 figures, 6 tables; Website: https://mirai-llm.github.io/