ICDAR 2023 面向密集与小文本的的视频文本读取竞赛
计算机视觉与模式识别
2023-04-11 v1
摘要
近年来,自然场景中的视频文本检测、跟踪与识别在计算机视觉界变得非常流行。然而,大多数现有算法与基准聚焦于常见文本情形(如正常尺寸、密度)与单一场景,而忽略了极端视频文本挑战,即多种场景中的密集与小文本。在本竞赛报告中,我们建立了一个视频文本读取基准 DSText,其聚焦于多种场景下视频中密集与小文本的读取挑战。相较于先前的数据集,所提数据集主要包括三个新挑战:1) 密集视频文本,这是视频文本定位器的新挑战。2) 高占比小文本。3) 多种新场景,如游戏、体育等。所提 DSText 包含来自 12 个开放场景的 100 个视频片段,支持两项任务(即视频文本跟踪(任务 1)与端到端视频文本定位(任务 2))。在竞赛期间(2023 年 2 月 15 日开放,2023 年 3 月 20 日关闭),共有 24 支队伍参与了三项所提任务,每项分别约有 30 份有效提交。本文中,我们描述了数据集、任务、评估协议以及 ICDAR 2023 DSText 竞赛的结果摘要的详细统计信息。此外,我们希望该基准能推动学界中的视频文本研究。
引用
@article{arxiv.2304.04376,
title = {ICDAR 2023 Video Text Reading Competition for Dense and Small Text},
author = {Weijia Wu and Yuzhong Zhao and Zhuang Li and Jiahong Li and Mike Zheng Shou and Umapada Pal and Dimosthenis Karatzas and Xiang Bai},
journal= {arXiv preprint arXiv:2304.04376},
year = {2023}
}