基于可变形卷积的聚焦增强场景文本识别
计算机视觉与模式识别
2022-05-06 v2
摘要
近年来,基于深度学习的场景文本识别方法在计算机视觉领域大量涌现。现有方法取得了优异性能,但由于形状多样与畸变模式,不规则文本的识别仍具挑战性。考虑到在现实世界中阅读单词时,我们通常不会在脑海中将其矫正,而是调整我们的焦点与视野。类似地,通过利用几何结构可调的可变形卷积层,我们在本工作中提出了一种无需矫正步骤的增强识别网络来处理不规则文本。我们进行了大量实验,在公开基准上的结果证明了我们所提组件的有效性,并表明我们的方法达到了令人满意的性能。代码将很快在 https://github.com/Alpaca07/dtr 公开。
引用
@article{arxiv.1908.10998,
title = {Focus-Enhanced Scene Text Recognition with Deformable Convolutions},
author = {Linjie Deng and Yanxiang Gong and Xinchen Lu and Xin Yi and Zheng Ma and Mei Xie},
journal= {arXiv preprint arXiv:1908.10998},
year = {2022}
}