中文

缩小 DETR 与 R-CNN 在文档图像图形对象检测中的性能差距

计算机视觉与模式识别 2023-06-26 v1

摘要

本文在缩小 DETR 与 R-CNN 用于图形对象检测的性能差距方面迈出了重要一步。现有的图形对象检测方法已受益于近期基于 CNN 的对象检测方法的改进,取得了显著进展。近来,基于 Transformer 的检测器大幅提升了通用对象检测性能,消除了对手工特征或诸如使用对象查询的非极大值抑制(NMS)等后处理步骤的需求。然而,此类增强的基于 transformer 的检测算法在图形对象检测问题上的有效性尚待验证。本质上,受 DETR 最新进展的启发,我们采用现有检测 transformer 并作少量修改用于图形对象检测。我们以不同方式修改对象查询,使用点、锚框并向锚框添加正负噪声以提升性能。这些修改能更好地处理具有不同尺寸与长宽比的对象,对对象位置与尺寸的微小变化更具鲁棒性,并改善对象与非对象间的图像判别。我们在四个图形数据集上评估我们的方法:PubTables、TableBank、NTable 与 PubLaynet。在 DETR 中集成查询修改后,我们超越了先前工作,并在 TableBank、PubLaynet、PubTables 上分别以 96.9%、95.7% 和 99.3% 的 mAP 取得了新的最先进结果。大量消融实验结果表明,基于 transformer 的方法在文档分析中与其他应用类似更为有效。我们希望本研究能引起更多对文档图像分析中使用检测 transformer 研究的关注。

关键词

引用

@article{arxiv.2306.13526,
  title  = {Bridging the Performance Gap between DETR and R-CNN for Graphical Object Detection in Document Images},
  author = {Tahira Shehzadi and Khurram Azeem Hashmi and Didier Stricker and Marcus Liwicki and Muhammad Zeshan Afzal},
  journal= {arXiv preprint arXiv:2306.13526},
  year   = {2023}
}