HybriDLA:用于文档布局分析的混合生成
计算机视觉与模式识别
2025-11-26 v1
摘要
传统文档布局分析(DLA)通常依赖经验先验或在单次前向传递中执行的固定可学习查询集合。虽然对早期生成的文档足够,且能够处理数量有限且预定好的区域,但这种范式在处理当代文档时面临挑战,因为这些文档具有多样化的元素计数和日益复杂的布局。为解决现代文档所面临的挑战,我们提出了 HybriDLA,一种将扩散和自回归解码统一于单层内的新型生成框架。扩散组件不断细化边界框假设,而自回归组件则注入语义和上下文 awareness,使其即使在高度变化的布局中也能实现精确的区域预测。为进一步提升检测质量,我们设计了一种多尺度特征融合编码器,能够捕获细粒度和高层视觉线索。该架构将性能提升至 83.5% 的平均精度(mAP)。在 DocLayNet 和 MDoc 基准上的大量实验表明,HybriDLA 达到了状态的最佳性能,显著优于以前的方法。所有数据和模型将在 https://yufanchen96.github.io/projects/HybriDLA 上公开。
引用
@article{arxiv.2511.19919,
title = {HybriDLA: Hybrid Generation for Document Layout Analysis},
author = {Yufan Chen and Omar Moured and Ruiping Liu and Junwei Zheng and Kunyu Peng and Jiaming Zhang and Rainer Stiefelhagen},
journal= {arXiv preprint arXiv:2511.19919},
year = {2025}
}
备注
Accepted by AAAI 2026 (Oral). Project page at https://yufanchen96.github.io/projects/HybriDLA