中文

通过时间聚类迈向时空视频场景文本检测

计算机视觉与模式识别 2020-11-20 v1

摘要

现有视频场景文本检测(VSTD)基准仅含空间域边界框标注,缺乏视频帧间文本实例的时间关联,阻碍了视频文本相关应用的发展。本文系统性地引入一个新的大规模基准STVText4、一个精心设计的时空检测度量(STDM)以及一种新颖的基于聚类的基线方法,称为时间聚类(TC)。STVText4开辟了VSTD中一个具挑战但前景广阔的方向,称为ST-VSTD,旨在同时检测空间和时间域中的视频场景文本。STVText4包含来自106个视频的161,347帧视频中超过140万个文本实例,每个实例不仅标注了空间边界框和时间范围,还标注了包括易读性、密度、尺度和生命周期在内的四种固有属性,以惠及社区。借助视频序列中相同文本的连续传播,TC可准确输出文本的空间四边形和时间范围,为ST-VSTD设立了强基线。实验证明了我们方法的有效性以及STVText4巨大的学术与实用价值。数据集与代码将很快公开。

关键词

引用

@article{arxiv.2011.09781,
  title  = {Towards Spatio-Temporal Video Scene Text Detection via Temporal Clustering},
  author = {Yuanqiang Cai and Chang Liu and Weiqiang Wang and Qixiang Ye},
  journal= {arXiv preprint arXiv:2011.09781},
  year   = {2020}
}