中文

面向鲁棒分布外视觉文档理解的结构化布局先验

计算机视觉与模式识别 2026-05-20 v1

摘要

视觉-语言模型(VLM)端到端地解析文档,但经常在不同于训练中见过的布局上失效。我们将此归因于一个两跳瓶颈:在解码器能够提取内容(第二跳)之前,它必须首先分类并定位包围的布局实体(第一跳),而当第一跳失败时,第二跳会崩溃为遗漏、畸形结构或自回归重复。我们通过在解码器外部运行一个轻量级RT-DETR检测器,将其输出序列化为解析器原生的DocTags词汇,并将其与完整页面图像一起注入到提示中,从而预先解决第一跳。与裁剪页面的先分析后解析方法,或先前用纯文本编写的提示级先验不同,我们的先验共享解码器的生成空间,并在检测有噪声时将全局图像保留在视野中作为后备。在一个1万页的结构化分布外基准测试中,markdown F1从0.370.37提升至0.920.92;在OmniDocBench的中文子集上,表格TEDS从0.010.01提升至0.360.36;在2.6万页的ViDoRe V3基准测试中,无限循环解码失败在所有测试的工业领域均有所下降。这些增益的代价是15%15\%的挂钟延迟和平均7474个提示token,且无需对基础VLM进行架构更改。注意力层面的分析进一步揭示了一种双模态相移,其中解码器在发出结构时关注注入的布局token,而在发出内容时关注图像块,这与两跳瓶颈得到缓解的情况一致。模型权重将被发布以支持可复现性。

关键词

引用

@article{arxiv.2605.19866,
  title  = {Structured Layout Priors for Robust Out-of-Distribution Visual Document Understanding},
  author = {Peter El Hachem and Ahmed Nassar and A. Said Gurbuz and Christoph Auer and Peter W. J. Staar},
  journal= {arXiv preprint arXiv:2605.19866},
  year   = {2026}
}

备注

18 pages, 7 figures. Main text: 9 pages (4 figures); Appendix: 9 pages (3 figures)