中文

DSText V2:面向密集与微小文本的综合视频文本定位数据集

计算机视觉与模式识别 2023-12-06 v1

摘要

近年来,自然场景中的视频文本检测、跟踪与识别在计算机视觉社区中变得非常流行。然而,现有的多数算法和基准测试集中于常见文本情况(例如,正常尺寸、密度)和单一场景,而忽略了极端的视频文本挑战,即各种场景中的密集和微小文本。在本文中,我们建立了一个名为 DSText V2 的视频文本阅读基准,重点关注各种场景视频中密集和微小文本的阅读挑战。与以往的数据集相比,提出的数据集主要包含三个新挑战:1)密集视频文本,这是视频文本定位器在跟踪和阅读方面的新挑战。2)高比例的微小文本,加上视频中的模糊和扭曲,将带来进一步的挑战。3)各种新场景,例如游戏、体育等。提出的 DSText V2 包含来自 7 个开放场景的 140 个视频片段,支持三项任务,即视频文本检测(任务 1)、视频文本跟踪(任务 2)和端到端视频文本定位(任务 3)。在本文中,我们描述了数据集、任务、评估协议的详细统计信息以及结果总结。最重要的是,我们针对数据集衍生的三个独特挑战进行了彻底的调查和分析,旨在提供新的见解。此外,我们希望该基准能促进社区中的视频文本研究。DSText v2 是在 DSText v1 的基础上构建的,后者此前被引入用于组织 ICDAR 2023 密集和微小视频文本竞赛。

关键词

引用

@article{arxiv.2312.01938,
  title  = {DSText V2: A Comprehensive Video Text Spotting Dataset for Dense and Small Text},
  author = {Weijia Wu and Yiming Zhang and Yefei He and Luoming Zhang and Zhenyu Lou and Hong Zhou and Xiang Bai},
  journal= {arXiv preprint arXiv:2312.01938},
  year   = {2023}
}

备注

arXiv admin note: text overlap with arXiv:2304.04376