中文

掩码即所需:重新思考 Mask R-CNN 用于密集与任意形状场景文本检测

计算机视觉与模式识别 2021-09-09 v1

摘要

由于目标检测与实例分割领域的巨大成功,Mask R-CNN 引起了广泛关注,并被广泛采用作为任意形状场景文本检测与 spotting 的强基线。然而,仍有两方面问题有待解决。其一是密集文本情形,这易被忽视但却相当实际。一个 proposal 中可能存在多个实例,这使得 mask head 难以区分不同实例并导致性能下降。在本工作中,我们认为性能下降源于 mask head 中的学习混淆问题。我们提出使用 MLP 解码器替代 mask head 中的“deconv-conv”解码器,从而缓解该问题并显著提升鲁棒性。我们还提出实例感知掩码学习,其中 mask head 学习预测整个实例的形状,而非将每个像素分类为文本或非文本。通过实例感知掩码学习,mask 分支可学习到分离且紧凑的掩码。其二是由于尺度和长宽比变化巨大,RPN 需要复杂的锚框设置,难以在不同数据集间维护与迁移。为解决此问题,我们提出自适应标签分配,保证所有实例尤其是那些具有极端长宽比的实例关联到足够多的锚框。结合这些组件,所提方法 MAYOR 在 DAST1500、MSRA-TD500、ICDAR2015、CTW1500 和 Total-Text 五个基准上取得了最先进的性能。

关键词

引用

@article{arxiv.2109.03426,
  title  = {Mask is All You Need: Rethinking Mask R-CNN for Dense and Arbitrary-Shaped Scene Text Detection},
  author = {Xugong Qin and Yu Zhou and Youhui Guo and Dayan Wu and Zhihong Tian and Ning Jiang and Hongbin Wang and Weiping Wang},
  journal= {arXiv preprint arXiv:2109.03426},
  year   = {2021}
}

备注

Accepted by ACM MM 2021