一种具有在线跟踪的端到端视频文本检测器
计算机视觉与模式识别
2019-08-21 v1
摘要
视频文本检测因以下两个挑战被视为文档分析中最困难的任务之一:1)由视频场景引起的困难,即运动模糊、光照变化和遮挡;2)文本的属性,包括字体、语言、方向和形状的多样性。大多数现有方法试图通过结合视频文本跟踪来提升视频文本检测性能,但将这两项任务分开处理。本工作中,我们提出一种具有在线跟踪的端到端视频文本检测模型以应对这两大挑战。具体而言,在检测分支中,我们采用 ConvLSTM 来捕获空间结构信息与运动记忆。在跟踪分支中,我们将跟踪问题转化为文本实例关联,并提出一种带记忆机制的外观-几何描述子以生成文本实例的鲁棒表示。通过将这两个分支整合至一个可训练框架中,它们可相互促进,且计算成本显著降低。在包括 ICDAR2013 Video、Minetto 和 YVT 的现有视频文本基准上的实验表明,所提方法显著优于最先进的方法。我们的方法在所有数据集上 F 值提升约 2,并且可在 TITAN Xp 上以 24.36 fps 实时运行。
引用
@article{arxiv.1908.07135,
title = {An End-to-end Video Text Detector with Online Tracking},
author = {Hongyuan Yu and Chengquan Zhang and Xuan Li and Junyu Han and Errui Ding and Liang Wang},
journal= {arXiv preprint arXiv:1908.07135},
year = {2019}
}