中文

一个双语、开放世界的视频文本数据集及基于 Transformer 的端到端视频文本 spotting 模型

计算机视觉与模式识别 2021-12-10 v1 计算与语言

摘要

大多数现有的视频文本 spotting 基准仅关注单一语言和有限数据的场景评估。在本文中,我们引入了一个大规模、双语、开放世界视频文本基准数据集(BOVText)。BOVText 具有四个特点。首先,我们提供 2,000+ 个视频,包含超过 1,750,000+ 帧,比现有最大的视频 incidental 文本数据集大 25 倍。其次,我们的数据集涵盖 30+ 个开放类别,广泛选取了多种场景,例如生活 Vlog、驾驶、电影等。第三,提供了丰富的文本类型标注(即标题、字幕或场景文本),以表示视频中不同的表征含义。第四,BOVText 提供双语文本标注,以促进多元文化生存与交流。此外,我们提出了一种基于 Transformer 的端到端视频文本 spotting 框架,称为 TransVTSpotter,它以简单而高效的基于注意力的查询-键机制解决视频中的多方向文本 spotting。它将前一帧的目标特征作为当前帧的跟踪查询,并引入旋转角度预测以适配多方向文本实例。在 ICDAR2015(video)上,TransVTSpotter 以 44.1% MOTA、9 fps 取得了最先进(SOTA)性能。BOVText 和 TransVTSpotter 的代码可分别见于 github:com=weijiawu=BOVText 和 github:com=weijiawu=TransVTSpotter。

关键词

引用

@article{arxiv.2112.04888,
  title  = {A Bilingual, OpenWorld Video Text Dataset and End-to-end Video Text Spotter with Transformer},
  author = {Weijia Wu and Yuanqiang Cai and Debing Zhang and Sibo Wang and Zhuang Li and Jiahong Li and Yejun Tang and Hong Zhou},
  journal= {arXiv preprint arXiv:2112.04888},
  year   = {2021}
}

备注

20 pages, 6 figures