MOST:一种带定位精修的多方向场景文本检测器
计算机视觉与模式识别
2021-04-06 v2
摘要
过去几年中,场景文本检测领域进展迅速,现代文本检测器已能在多种挑战性场景中搜寻文本。然而,在处理极端长宽比与尺度多变的文本实例时,它们仍可能力有不逮。为应对此类困难,我们在本文中提出一种用于场景文本检测的新算法,其提出一组策略以显著提升文本定位质量。具体而言,提出文本特征对齐模块(TFAM)以基于初始原始检测动态调节特征感受野;设计位置感知非极大抑制(PA-NMS)模块以选择性关注可靠原始检测并排除不可靠者;此外,我们提出实例级 IoU 损失以实现平衡训练,处理不同尺度的文本实例。广泛的消融研究证明了所提策略的有效性与优越性。所得文本检测系统将所提策略与领先的场景文本检测器 EAST 集成,在各种标准文本检测基准上取得最先进或具竞争力的性能,同时保持较快运行速度。
引用
@article{arxiv.2104.01070,
title = {MOST: A Multi-Oriented Scene Text Detector with Localization Refinement},
author = {Minghang He and Minghui Liao and Zhibo Yang and Humen Zhong and Jun Tang and Wenqing Cheng and Cong Yao and Yongpan Wang and Xiang Bai},
journal= {arXiv preprint arXiv:2104.01070},
year = {2021}
}
备注
Accepted by CVPR21