IterVM:用于场景文本识别的迭代视觉建模模块
计算机视觉与模式识别
2022-04-07 v1
摘要
场景文本识别(STR)由于自然图像中不完善的图像条件而是一个具有挑战性的问题。最先进的方法利用视觉线索与语言知识来解决这一挑战性问题。具体而言,它们提出迭代语言建模模块(IterLM)来反复精炼来自视觉建模模块(VM)的输出序列。尽管取得了有前景的结果,视觉建模模块已成为这些方法性能瓶颈。在本文中,我们新提出迭代视觉建模模块(IterVM)以进一步提升 STR 准确率。具体而言,第一个 VM 直接从输入图像提取多级特征,随后的 VM 从输入图像重新提取多级特征,并将其与前一个 VM 提取的高层(即最具语义性的)特征相融合。通过将所提 IterVM 与迭代语言建模模块结合,我们进一步提出了一个强大的场景文本识别器称为 IterNet。大量实验表明所提 IterVM 能显著提升场景文本识别准确率,尤其在低质量场景文本图像上。此外,所提场景文本识别器 IterNet 在多个公开基准上取得了新的 SOTA 结果。代码将发布于 https://github.com/VDIGPKU/IterNet。
引用
@article{arxiv.2204.02630,
title = {IterVM: Iterative Vision Modeling Module for Scene Text Recognition},
author = {Xiaojie Chu and Yongtao Wang},
journal= {arXiv preprint arXiv:2204.02630},
year = {2022}
}
备注
Accepted by ICPR2022