SFDLA:无源文档版面分析
计算机视觉与模式识别
2025-06-19 v2
摘要
文档版面分析(DLA)是文档理解中的一项基础任务。然而,现有的 DLA 及其自适应方法通常需要访问大规模源数据和目标标签。这一要求严重限制了其在真实场景中的适用性,尤其是在隐私敏感且资源受限的领域,如财务报表、医疗记录和专有商业文档。据我们观察,将源域微调模型直接迁移到目标域往往会导致显著的性能下降(平均 -32.64%)。本工作中,我们提出无源文档版面分析(SFDLA),旨在将预训练的源 DLA 模型适配到无标签的目标域,且无需访问任何源数据。为应对这一挑战,我们建立了首个 SFDLA 基准,涵盖三个主流 DLA 数据集,用于几何感知和内容感知的适配。此外,我们提出了文档版面分析适配器(DLAdapter),一种旨在提升跨文档域无源适配性能的新颖框架。我们的方法在从 PubLayNet 到 DocLayNet 的迁移中,相较于仅源域基线取得了 +4.21% 的提升,相较于现有无源方法取得了 +2.26% 的提升。我们相信本工作将激发 DLA 社区进一步探索无源文档理解。为支持社区未来的研究,基准、模型及代码将在 https://github.com/s3setewe/sfdla-DLAdapter 公开。
引用
@article{arxiv.2503.18742,
title = {SFDLA: Source-Free Document Layout Analysis},
author = {Sebastian Tewes and Yufan Chen and Omar Moured and Jiaming Zhang and Rainer Stiefelhagen},
journal= {arXiv preprint arXiv:2503.18742},
year = {2025}
}
备注
Accepted by ICDAR 2025. The benchmark, models, and code will be publicly available at https://github.com/s3setewe/sfdla-DLAdapter