中文

HybriDLA:用于文档布局分析的混合生成

计算机视觉与模式识别 2025-11-26 v1

摘要

传统文档布局分析(DLA)通常依赖经验先验或在单次前向传递中执行的固定可学习查询集合。虽然对早期生成的文档足够,且能够处理数量有限且预定好的区域,但这种范式在处理当代文档时面临挑战,因为这些文档具有多样化的元素计数和日益复杂的布局。为解决现代文档所面临的挑战,我们提出了 HybriDLA,一种将扩散和自回归解码统一于单层内的新型生成框架。扩散组件不断细化边界框假设,而自回归组件则注入语义和上下文 awareness,使其即使在高度变化的布局中也能实现精确的区域预测。为进一步提升检测质量,我们设计了一种多尺度特征融合编码器,能够捕获细粒度和高层视觉线索。该架构将性能提升至 83.5% 的平均精度(mAP)。在 DocLayNet 和 M6^6Doc 基准上的大量实验表明,HybriDLA 达到了状态的最佳性能,显著优于以前的方法。所有数据和模型将在 https://yufanchen96.github.io/projects/HybriDLA 上公开。

关键词

引用

@article{arxiv.2511.19919,
  title  = {HybriDLA: Hybrid Generation for Document Layout Analysis},
  author = {Yufan Chen and Omar Moured and Ruiping Liu and Junwei Zheng and Kunyu Peng and Jiaming Zhang and Rainer Stiefelhagen},
  journal= {arXiv preprint arXiv:2511.19919},
  year   = {2025}
}

备注

Accepted by AAAI 2026 (Oral). Project page at https://yufanchen96.github.io/projects/HybriDLA