中文

CiteVQA: 为可信文档智能提供证据归因基准

计算与语言 2026-05-14 v1 计算机视觉与模式识别

摘要

多模态大语言模型(MLLMs)已显著推进文档理解,但当前的Doc-VQA评估仅评分最终答案,未检查支撑证据。这种仅评估答案的做法掩盖了一个关键失效模式:模型可能在错误段落中获得正确答案——在法律、金融和医疗等高风险领域,这一现象尤为危险,因为每项结论都必须可追溯到特定来源区域。为此,我们引入CiteVQA,要求模型在每个答案旁返回元素级边界框引用,联合评估答案与引用。CiteVQA包含1897个问题,覆盖711份PDF,跨七个领域和两种语言,平均每份文档约40.6页。为确保信度和可扩展性,地面引用通过自动化管道生成——该管道通过掩码消除识别关键证据——并经专家审核。我们核心评估指标严格归因准确率(Strict Attributed Accuracy, SAA),仅当答案和引用区域均正确时才给予积分。审查20个MLLMs后发现普遍的归因幻觉:模型常在引用错误区域的同时给出正确答案。最强系统(Gemini-3.1-Pro-Preview)的SAA仅为76.0%,最强开源MLLM仅为22.5%。最终就可信文档智能而言,CiteVQA暴露了答案唯一评估所忽视的可靠性差距,提供了必要的工具以弥合这一差距。我们的仓库已公开于https://github.com/opendatalab/CiteVQA。

关键词

引用

@article{arxiv.2605.12882,
  title  = {CiteVQA: Benchmarking Evidence Attribution for Trustworthy Document Intelligence},
  author = {Dongsheng Ma and Jiayu Li and Zhengren Wang and Yijie Wang and Jiahao Kong and Weijun Zeng and Jutao Xiao and Jie Yang and Wentao Zhang and Bin Wang and Conghui He},
  journal= {arXiv preprint arXiv:2605.12882},
  year   = {2026}
}