中文

索引轻盈,推理深入:面向视觉稠密文档问答的延迟视觉摄取

计算与语言 2026-02-27 v2 计算机视觉与模式识别 信息检索

摘要

现有的多模态文档问答方法主要采用预摄取 (Pre-Ingestion, PI) 策略:在索引阶段,对每一页调用视觉语言模型 (VLM) 生成页面描述,再编码为向量,通过嵌入相似性检索来回答问题。然而,该方法在视觉稠密工程文档上面临双重困境:VLM 的盲目描述不可避免地丢失关键视觉细节,嵌入检索在高度相似文档上系统性失效。本文提出延迟视觉摄取 (Deferred Visual Ingestion, DVI) 框架:预处理阶段零调用 VLM,仅利用文档结构信息 (目录、图号) 通过 HDNC (层级图号聚类) 算法自动构建层级索引;推理阶段通过 BM25 检索定位候选页面,将原始图像与具体问题一起发送给 VLM 进行针对性分析。大规模实验在三个数据集上验证了 DVI 的有效性:在桥梁工程图 (1,323个问题) 上,端到端 QA 准确率达65.6% vs. PI的24.3% (+41.3pp);在钢材目录 (186个问题) 上,30.6% vs. 16.1% (+14.5pp);在CircuitVQA公共基准 (9,315个问题) 上,检索 ImgR@3 达31.2% vs. 0.7%。在桥梁数据集上,我们评估了ColPali (ICLR 2025 视觉检索 SOTA),其仅获20.1% PageR@3,表明工程文档中嵌入检索的失败是结构性的,而非模型能力不足。消融实验表明,HDNC 零成本自动索引可带来+27.5pp 检索提升,VLM 转换率分析确认瓶颈在检索端而非理解端。

关键词

引用

@article{arxiv.2602.14162,
  title  = {Index Light, Reason Deep: Deferred Visual Ingestion for Visual-Dense Document Question Answering},
  author = {Tao Xu},
  journal= {arXiv preprint arXiv:2602.14162},
  year   = {2026}
}

备注

24 pages, 4 figures, 7 tables