DocVAL:经验证的链条思维蒸馏用于文档视觉问答
计算机视觉与模式识别
2026-05-25 v3 人工智能
摘要
文档视觉问答要求模型不仅要正确回答问题,还要在复杂文档布局中精确定位答案。虽然大型视觉语言模型(VLM)在空间定位方面取得了强大的成绩,但其推理成本和延迟限制了实际部署。紧凑型 VLM 更高效,但在标准微调或蒸馏下常出现显著的定位性能下降。为此,我们提出 DocVAL——一种经验证的链条思维(CoT)蒸馏框架,将大型教师模型中的显式空间推理知识传递给紧凑且可部署的学生 VLM。DocVAL 结合了(1)教师生成的空间 CoT 监督信号,(2)基于规则的双模式验证器,用于筛选低质量训练信号并提供细粒度的像素级纠错反馈,以及(3)以验证驱动的两阶段训练程序,包含迭代式细化。仅作为训练时的脚手架用于监督和验证,最终的学生模型可作为纯粹的 VLM 在推理时无需 OCR 或检测。跨多个文档理解基准测试,DocVAL 在相当 comparable 的紧凑型 VLM 上实现了最高可达 6~7 分 ANLS 的持续性提升。我们进一步引入均值平均精度(mAP)作为文档问答的定位指标,并报告了在该新评估下的强大空间定位性能。我们发布了 9.5 万条经验证的 CoT 轨迹,表明高质量、经验证的监督信号比扩大未过滤数据更为有效,从而实现了高效可信的文档定位。代码/数据:https://github.com/ahmad-shirazi/DocVAL
引用
@article{arxiv.2511.22521,
title = {DocVAL: Validated Chain-of-Thought Distillation for Grounded Document VQA},
author = {Pinaki Prasad Guha Neogi and Ahmad Mohammadshirazi and Ser-Nam Lim and Rajiv Ramnath},
journal= {arXiv preprint arXiv:2511.22521},
year = {2026}
}