中文

面向长文档理解的多智能体交互式问答生成框架

计算与语言 2025-07-29 v1 人工智能

摘要

在包含复杂布局的长情境场景中,文档理解(Document Understanding, DU)仍是视觉语言研究中的重大挑战。尽管大型视觉语言模型(Large Vision-Language Models, LVLMs)在短情境 DU 任务中表现出色,但在长情境设置下的性能却下降。其关键限制是稀缺的细粒度训练数据,尤其是对低资源语言如阿拉伯语。现有最先进技术高度依赖人工标注,成本高昂且效率低下。我们提出了一个全自动的多智能体交互式框架,用于高效生成长情境问答。该方法高效地为广泛覆盖不同领域的大量英文和阿拉伯语文档(涵盖数百页)生成高质量的单页和多页问答,促进开发具备增强长情境理解能力的 LVLMs。本文的实验结果表明,我们生成的英文和阿拉伯语问答(\textbf{AraEngLongBench})对主流开源和闭源 LVLMs 具有较大挑战性。本文提出的代码和数据可在 https://github.com/wangk0b/Multi_Agentic_QA_Long_Doc.git 获取。附录中提供了示例问答(QA)对和结构化系统提示。

关键词

引用

@article{arxiv.2507.20145,
  title  = {Multi-Agent Interactive Question Generation Framework for Long Document Understanding},
  author = {Kesen Wang and Daulet Toibazar and Abdulrahman Alfulayt and Abdulaziz S. Albadawi and Ranya A. Alkahtani and Asma A. Ibrahim and Haneen A. Alhomoud and Sherif Mohamed and Pedro J. Moreno},
  journal= {arXiv preprint arXiv:2507.20145},
  year   = {2025}
}