用于场景文本识别的类感知掩码引导特征精炼
计算机视觉与模式识别
2024-02-22 v1
摘要
场景文本识别是一个快速发展的领域,由于场景文本的复杂性和多样性,包括复杂的背景、多样的字体、灵活的排列和偶然的遮挡,该领域面临诸多挑战。在本文中,我们提出了一种名为类感知掩码引导特征精炼 (CAM) 的新方法来应对这些挑战。我们的方法引入了由标准字体生成的规范类感知字形掩码,以有效抑制背景和文本风格噪声,从而增强特征判别力。此外,我们设计了一个特征对齐与融合模块,以结合规范掩码指导,进一步精炼文本识别的特征。通过增强规范掩码特征与文本特征之间的对齐,该模块确保了更有效的融合,最终带来识别性能的提升。我们首先在六个标准文本识别基准上评估了 CAM 以证明其有效性。此外,尽管使用了更小的模型大小,CAM 在六个更具挑战性的数据集上比最先进的方法平均性能提升了 4.1%,展现出优越性。我们的研究强调了结合规范掩码指导和对齐特征精炼技术对于鲁棒场景文本识别的重要性。代码可在 https://github.com/MelosY/CAM 获取。
引用
@article{arxiv.2402.13643,
title = {Class-Aware Mask-Guided Feature Refinement for Scene Text Recognition},
author = {Mingkun Yang and Biao Yang and Minghui Liao and Yingying Zhu and Xiang Bai},
journal= {arXiv preprint arXiv:2402.13643},
year = {2024}
}
备注
Accepted by Pattern Recognition