中文

面向文本跟踪的语义与视觉表示对比学习

计算机视觉与模式识别 2022-08-22 v3 人工智能

摘要

语义表示对需要同时在视频中分类、检测与跟踪文本的 video text tracking(VTT,视频文本跟踪)任务大有裨益。多数现有方法通过连续帧中的外观相似性处理该任务,却忽略了丰富的语义特征。本文中,我们探索利用语义与视觉表示的对比学习来鲁棒地跟踪视频文本。相应地,我们提出一个端到端的具有语义与视觉表示(SVRep)的视频文本跟踪器,其通过利用视频序列中不同文本间的视觉与语义关系来检测并跟踪文本。此外,凭借轻量架构,SVRep 在保持有竞争力的推理速度的同时取得了最先进的性能。具体而言,以 ResNet-18 为骨干,SVRep 在 ICDAR2015(video)数据集上取得 IDF1{\rm ID_{F1}}65.9%\textbf{65.9\%},以 16.7\textbf{16.7} FPS 运行,较先前最先进方法提升 8.6%\textbf{8.6\%}

关键词

引用

@article{arxiv.2112.14976,
  title  = {Contrastive Learning of Semantic and Visual Representations for Text Tracking},
  author = {Zhuang Li and Weijia Wu and Mike Zheng Shou and Jiahong Li and Size Li and Zhongyuan Wang and Hong Zhou},
  journal= {arXiv preprint arXiv:2112.14976},
  year   = {2022}
}

备注

Merge the paper with arXiv article 2207.08417. We will withdraw the two papers and create new one