中文

You Only Recognize Once:迈向快速视频文本定位

计算机视觉与模式识别 2021-10-26 v3

摘要

由于具有广泛的实际应用,视频文本定位仍是一个重要的研究课题。以往的方法通常采用四阶段流程:在单帧图像中进行文本检测、逐帧识别定位的文本区域、跟踪文本流以及通过复杂的后处理技术生成最终结果,这可能会带来巨大的计算成本以及低质量文本的干扰。在本文中,我们提出了一种快速且鲁棒的视频文本定位框架,仅对定位的文本进行一次识别,而非逐帧识别。具体而言,我们首先利用一个精心设计的时空检测器获取视频中的文本区域。然后,我们致力于开发一种新颖的文本推荐器,用于从文本流中选择最高质量的文本并仅对所选文本进行识别。在此,该推荐器将文本跟踪、质量评分和识别集成到一个端到端可训练的模块中,这不仅避免了低质量文本的干扰,还极大地加速了视频文本定位过程。此外,为了推动视频文本定位社区的发展,我们收集了一个更大规模的视频文本数据集(LSVTD),其中包含来自 22 种不同真实生活场景的 100 个文本视频。在两个公开基准上的大量实验表明,与逐帧方式相比,我们的方法平均将识别过程加速了 71 倍,并且取得了显著的 SOTA(state-of-the-art)表现。

关键词

引用

@article{arxiv.1903.03299,
  title  = {You Only Recognize Once: Towards Fast Video Text Spotting},
  author = {Zhanzhan Cheng and Jing Lu and Yi Niu and Shiliang Pu and Fei Wu and Shuigeng Zhou},
  journal= {arXiv preprint arXiv:1903.03299},
  year   = {2021}
}

备注

Accepted by ACM Multimedia 2019. Code is available at https://davar-lab.github.io/publication.html or https://github.com/hikopensource/DAVAR-Lab-OCR