中文

基于对比表征学习的实时端到端视频文本 spotting 方法

计算机视觉与模式识别 2022-08-22 v3

摘要

视频文本 spotting(VTS)是一项需要同时在视频中检测、跟踪和识别文本的任务。现有的视频文本 spotting 方法通常构建复杂的流水线和多个模型,不利于实时应用。本文提出一种基于对比表征学习的实时端到端视频文本 spotter(CoText)。我们的贡献有三点:1)CoText 在实时端到端可训练框架中同时解决三项任务(如文本检测、跟踪、识别)。2)通过对比学习,CoText 建模长程依赖并学习跨多帧的时间信息。3)设计了一个简单、轻量的架构以实现高效且准确的性能,包括 GPU 并行检测后处理、基于 Masked RoI 的 CTC 识别头。大量实验证明了我们方法的优越性。特别地,CoText 在 ICDAR2015video 上以 41.0 FPS 取得 72.0% 的视频文本 spotting IDF1,相较此前最佳方法分别提升 10.5% 和 32.0 FPS。代码见 github.com/weijiawu/CoText。

关键词

引用

@article{arxiv.2207.08417,
  title  = {Real-time End-to-End Video Text Spotter with Contrastive Representation Learning},
  author = {Wejia Wu and Zhuang Li and Jiahong Li and Chunhua Shen and Hong Zhou and Size Li and Zhongyuan Wang and Ping Luo},
  journal= {arXiv preprint arXiv:2207.08417},
  year   = {2022}
}

备注

merge the paper with arXiv article 2207.08417. We will withdraw the two paper and create new one