中文

AirQA:用于 AI 研究的全面实例级 QA 数据集

计算与语言 2026-03-31 v2 人工智能

摘要

学术论文的数量不断增加,研究人员高效提取关键信息已变得日益困难。虽然基于大型语言模型(LLM)的智能体在自动化问答(QA)工作流程中具有处理能力,但缺乏全面且真实可靠的基准进行评估。此外,训练针对此特定任务的交互式智能体也受限于高质量交互轨迹的稀缺。本文提出了 AirQA,一个由人工标注的全面论文 QA 数据集,覆盖人工智能(AI)领域,包含 13,956 篇论文和 1,246 个问题,涵盖多任务、多模态和实例级评估。此外,我们提出了 ExTrActor,一个用于指令数据合成的自动框架。该框架通过三个 LLM-based 智能体,能够在无需人工干预的情况下完成示例生成和轨迹收集。对多个开源和专有模型进行评估显示,大多数模型在 AirQA 上表现不佳,证明了我们数据集的质量。广泛的实验表明,ExTrActor 能稳定地提高小型模型的多轮工具使用能力,使其能够实现与大型模型相当的性能。

关键词

引用

@article{arxiv.2509.16952,
  title  = {AirQA: A Comprehensive QA Dataset for AI Research with Instance-Level Evaluation},
  author = {Tiancheng Huang and Ruisheng Cao and Yuxin Zhang and Zhangyi Kang and Zijian Wang and Chenrun Wang and Yijie Luo and Hang Zheng and Lirong Qian and Lu Chen and Kai Yu},
  journal= {arXiv preprint arXiv:2509.16952},
  year   = {2026}
}

备注

29 page, 6 figures, 17 tables, accepted to ICLR 2026