面向鲁棒分布外视觉文档理解的结构化布局先验
计算机视觉与模式识别
2026-05-20 v1
摘要
视觉-语言模型(VLM)端到端地解析文档,但经常在不同于训练中见过的布局上失效。我们将此归因于一个两跳瓶颈:在解码器能够提取内容(第二跳)之前,它必须首先分类并定位包围的布局实体(第一跳),而当第一跳失败时,第二跳会崩溃为遗漏、畸形结构或自回归重复。我们通过在解码器外部运行一个轻量级RT-DETR检测器,将其输出序列化为解析器原生的DocTags词汇,并将其与完整页面图像一起注入到提示中,从而预先解决第一跳。与裁剪页面的先分析后解析方法,或先前用纯文本编写的提示级先验不同,我们的先验共享解码器的生成空间,并在检测有噪声时将全局图像保留在视野中作为后备。在一个1万页的结构化分布外基准测试中,markdown F1从提升至;在OmniDocBench的中文子集上,表格TEDS从提升至;在2.6万页的ViDoRe V3基准测试中,无限循环解码失败在所有测试的工业领域均有所下降。这些增益的代价是的挂钟延迟和平均个提示token,且无需对基础VLM进行架构更改。注意力层面的分析进一步揭示了一种双模态相移,其中解码器在发出结构时关注注入的布局token,而在发出内容时关注图像块,这与两跳瓶颈得到缓解的情况一致。模型权重将被发布以支持可复现性。
引用
@article{arxiv.2605.19866,
title = {Structured Layout Priors for Robust Out-of-Distribution Visual Document Understanding},
author = {Peter El Hachem and Ahmed Nassar and A. Said Gurbuz and Christoph Auer and Peter W. J. Staar},
journal= {arXiv preprint arXiv:2605.19866},
year = {2026}
}
备注
18 pages, 7 figures. Main text: 9 pages (4 figures); Appendix: 9 pages (3 figures)