PIMNet:一种用于场景文本识别的并行、迭代与模仿网络
计算机视觉与模式识别
2021-09-10 v1
摘要
如今,场景文本识别因其广泛的应用而受到越来越多的关注。大多数最先进的方法采用带有注意力机制的编码器-解码器框架,自左向右自回归地生成文本。尽管性能令人信服,但由于逐字解码策略,速度受到限制。与自回归模型相对,非自回归模型以更短的推理时间并行预测结果,但准确率明显落后于自回归模型。本文提出一种并行、迭代与模仿网络(PIMNet)以平衡准确率与效率。具体而言,PIMNet 采用并行注意力机制以更快地预测文本,并采用迭代生成机制使预测更准确。在每次迭代中,上下文信息被充分挖掘。为改善隐藏层的学习,我们在训练阶段利用模仿学习,引入一个额外的自回归解码器,使并行解码器通过拟合隐藏层的输出来模仿自回归解码器。由于两个解码器共享骨干网络,所提出的 PIMNet 无需预训练即可端到端训练。推理时,移除自回归解码器分支以获得更快的速度。在公开基准上的大量实验证明了 PIMNet 的有效性和效率。代码将发布于 https://github.com/Pay20Y/PIMNet。
引用
@article{arxiv.2109.04145,
title = {PIMNet: A Parallel, Iterative and Mimicking Network for Scene Text Recognition},
author = {Zhi Qiao and Yu Zhou and Jin Wei and Wei Wang and Yuan Zhang and Ning Jiang and Hongbin Wang and Weiping Wang},
journal= {arXiv preprint arXiv:2109.04145},
year = {2021}
}
备注
Accepted by ACM MM 2021