聚焦何种与何处:一种用于场景图像中任意形状邻近文本检测的简单而准确的框架
计算机视觉与模式识别
2021-09-09 v1
摘要
场景文本检测已引起研究人员的密切关注。尽管已提出许多针对水平和定向文本的方法,但先前的方法在处理任意形状文本(如弯曲文本)时可能表现不佳。特别是,在邻近文本实例的情况下会出现混淆问题。在本文中,我们提出了一种简单而有效的方法,用于准确的任意形状邻近场景文本检测。首先,设计了一种一对多训练方案(OMTS)以消除混淆,并使候选框在邻近文本实例情况下学习更合适的真值。其次,我们提出了一种候选框特征注意力模块(PFAM),以利用对每个候选框更有效的特征,从而更好地适应任意形状文本实例。最后,我们提出了一个基于Faster R-CNN并直接输出曲线表示的基线。配备PFAM和OMTS后,该检测器在多个具有挑战性的基准上取得了最先进或具竞争力的性能。
引用
@article{arxiv.2109.03451,
title = {Which and Where to Focus: A Simple yet Accurate Framework for Arbitrary-Shaped Nearby Text Detection in Scene Images},
author = {Youhui Guo and Yu Zhou and Xugong Qin and Weiping Wang},
journal= {arXiv preprint arXiv:2109.03451},
year = {2021}
}
备注
Accepted by ICANN 2021