中文

面向 OOV 场景文本识别的视觉-语言自适应互解码器

计算机视觉与模式识别 2023-10-31 v2

摘要

近期的研究表明,深度学习模型在常见词表内(IV)场景文本识别上取得了巨大成功。然而,在真实场景中,词表外(OOV)词至关重要,而 SOTA 识别模型在 OOV 设定下通常表现不佳。受“已学习的语言先验对 OOV 表现有限”这一直觉的启发,我们设计了一个名为视觉-语言自适应互解码器(VLAMD)的框架,以部分解决 OOV 问题。VLAMD 由三个主要组件构成。首先,我们构建了一个基于注意力的 LSTM 解码器,带有两个自适应融合的纯视觉模块,形成视觉-语言平衡的主分支。其次,我们添加了一个基于查询的自回归 transformer 解码头,用于通用视觉与语言先验表示学习。最后,我们将这两种设计与双向训练相结合以实现更多样的语言建模,并进行互序列解码以获得更鲁棒的结果。我们的方法在 ECCV 2022 TiE Workshop 的 OOV-ST Challenge 裁剪词识别任务上,于 IV+OOV 和 OOV 设定下分别取得了 70.31% 和 59.61% 的词准确率,并在两项设定下均获得第一名。

关键词

引用

@article{arxiv.2209.00859,
  title  = {Vision-Language Adaptive Mutual Decoder for OOV-STR},
  author = {Jinshui Hu and Chenyu Liu and Qiandong Yan and Xuyang Zhu and Jiajia Wu and Jun Du and Lirong Dai},
  journal= {arXiv preprint arXiv:2209.00859},
  year   = {2023}
}

备注

1st Place Solution to ECCV 2022 OOV-ST Challenge; ICIG 2023