中文

EpiBench:多模态代理多轮研究工作流基准测试

计算与语言 2026-04-08 v1

摘要

科学研究遵循多轮、多步骤的工作流,需要主动搜索文献、查阅图表,并整合多篇论文中的证据以对齐实验设置并支持可复现的结论。这种联合能力在现有基准测试中未得到系统评估,现有基准在很大程度上低估了主动搜索、多证据整合和持续证据使用。在这项工作中,我们引入了EpiBench,一个episodic多轮多模态基准实例化简短的研究工作流。给定研究任务,代理必须在多轮中跨论文导航,对齐来自图表和表格的证据,并利用记忆中积累的证据回答需要跨论文比较和多图表整合的客观问题。EpiBench引入了过程级评估框架,用于细粒度测试和诊断研究代理。我们的实验表明,即使是最先进的模型在困难分割上的准确率仅为29.23%,表明多轮多证据研究工作流仍有大幅改进空间,为可验证和可复现的研究代理提供了评估平台。

关键词

引用

@article{arxiv.2604.05557,
  title  = {EpiBench: Benchmarking Multi-turn Research Workflows for Multimodal Agents},
  author = {Xuan Dong and Huanyang Zheng and Tianhao Niu and Zhe Han and Pengzhan Li and Bofei Liu and Zhengyang Liu and Guancheng Li and Qingfu Zhu and Wanxiang Che},
  journal= {arXiv preprint arXiv:2604.05557},
  year   = {2026}
}