基于自适应多任务融合的文档图像矫正
计算机视觉与模式识别
2025-05-12 v1
摘要
变形文档图像矫正对于现实世界中的文档理解任务(如版面分析和文本识别)至关重要。然而,当前的多任务方法——如背景去除、3D坐标预测和文本行分割——常常忽略了任务间的互补特征及其相互作用。为解决这一问题,我们提出了一种名为SalmRec的自适应可学习多任务融合矫正网络。该网络包含一个任务间特征聚合模块,能够自适应地改善对几何畸变的感知,增强特征互补性,并减少负向干扰。我们还引入了一种门控机制,以有效平衡全局任务内部和局部任务之间的特征。在两个英文基准数据集(DIR300和DocUNet)和一个中文基准数据集(DocReal)上的实验结果表明,我们的方法显著提升了矫正性能。消融研究进一步凸显了不同任务对去畸变的积极影响以及我们所提出模块的有效性。
引用
@article{arxiv.2505.06038,
title = {Document Image Rectification Bases on Self-Adaptive Multitask Fusion},
author = {Heng Li and Xiangping Wu and Qingcai Chen},
journal= {arXiv preprint arXiv:2505.06038},
year = {2025}
}