CMFN:用于不规则场景文本识别的跨模态融合网络
计算机视觉与模式识别
2024-01-19 v1
摘要
场景文本识别作为涉及视觉和文本的跨模态任务,是计算机视觉中的一个重要研究课题。大多数现有方法使用语言模型提取语义信息以优化视觉识别。然而,在语义挖掘过程中忽视了视觉线索的指导,这限制了算法在识别不规则场景文本时的性能。为了解决这个问题,我们提出了一种用于不规则场景文本识别的新型跨模态融合网络 (CMFN),它将视觉线索纳入语义挖掘过程。具体而言,CMFN 由位置自增强编码器、视觉识别分支和迭代语义识别分支组成。位置自增强编码器为视觉识别分支和迭代语义识别分支提供字符序列位置编码。视觉识别分支基于 CNN 提取的视觉特征和位置自增强编码器提供的位置编码信息进行视觉识别。迭代语义识别分支由语言识别模块和跨模态融合门组成,模拟人类识别场景文本的方式,并整合跨模态视觉线索进行文本识别。实验表明,所提出的 CMFN 算法取得了与最先进算法相当的性能,证明了其有效性。
引用
@article{arxiv.2401.10041,
title = {CMFN: Cross-Modal Fusion Network for Irregular Scene Text Recognition},
author = {Jinzhi Zheng and Ruyi Ji and Libo Zhang and Yanjun Wu and Chen Zhao},
journal= {arXiv preprint arXiv:2401.10041},
year = {2024}
}
备注
Accepted to ICONIP 2023