中文

回答未能反映理解:揭示视觉文档理解中内部表征与回答之间的差距

计算与语言 2026-04-07 v1 人工智能 计算机视觉与模式识别

摘要

视觉文档理解(VDU)是大型视觉语言模型(LVLM)的一项具有挑战性的任务,需要整合视觉感知、文本识别和对结构化布局的推理。尽管最近的 LVLM 在 VDU 基准测试上取得了进展,但其性能通常基于生成的回答进行评估,这未必反映模型是否真正从内部捕获了所需信息。在本文中,我们使用线性探测方法研究了 LVLM 中不同层的 LLM 如何表征解决 VDU 任务所需的信息。我们的研究揭示:(1)内部表征与生成的回答之间存在明显差距,(2)解决任务所需的信息通常从中间层比从最终层更线性地编码。受这些发现的启发,我们探索了针对中间层的微调策略。实验表明,微调中间层同时提高了线性探测准确率和回答准确率,并缩小了差距。

关键词

引用

@article{arxiv.2604.04411,
  title  = {Responses Fall Short of Understanding: Revealing the Gap between Internal Representations and Responses in Visual Document Understanding},
  author = {Haruka Kawasaki and Ryota Tanaka and Kyosuke Nishida},
  journal= {arXiv preprint arXiv:2604.04411},
  year   = {2026}
}

备注

Accepted to CVPR2026 workshop (MULA)