多模态文本识别网络:视觉与语义特征间的交互增强
计算机视觉与模式识别
2022-08-16 v3
摘要
语言知识通过提供语义以精炼字符序列,为场景文本识别带来了巨大益处。然而,由于语言知识此前仅单独应用于输出序列,以往方法未能充分利用语义来理解用于文本识别的视觉线索。本文引入一种称为多模态文本识别网络(MATRN)的新方法,其实现视觉与语义特征之间的交互以获得更好的识别性能。具体而言,MATRN识别视觉与语义特征对,并将空间信息编码入语义特征。基于该空间编码,视觉与语义特征通过参考另一模态中的相关特征而得到增强。此外,MATRN在训练阶段通过隐藏与字符相关的视觉线索,促使将语义特征融合进视觉特征。我们的实验表明,MATRN在七个基准上以较大优势取得了SOTA性能,而两种模态的朴素组合仅显示出较弱的改进。进一步的消融研究证明了我们所提组件的有效性。我们的实现可在 https://github.com/wp03052/MATRN 获取。
引用
@article{arxiv.2111.15263,
title = {Multi-modal Text Recognition Networks: Interactive Enhancements between Visual and Semantic Features},
author = {Byeonghu Na and Yoonsik Kim and Sungrae Park},
journal= {arXiv preprint arXiv:2111.15263},
year = {2022}
}
备注
Accepted for publication at ECCV 2022