RoadText-1K:面向驾驶视频的文本检测与识别数据集
计算机视觉与模式识别
2020-05-20 v1
摘要
感知文本对于理解室外场景的语义至关重要,因此是构建用于驾驶辅助和自动驾驶的智能系统的关键要求。现有大多数用于文本检测和识别的数据集由静态图像组成,且大多在编纂时以文本为中心。本文介绍了一个新的用于驾驶视频中文本的“RoadText-1K”数据集。该数据集比现有最大的视频文本数据集大20倍。我们的数据集包含1000个驾驶视频片段,无任何针对文本的偏向,并对每一帧中的文本边界框和转写文本进行了标注。最先进的文本检测、识别和跟踪方法在新数据集上进行了评估,结果表明与现有数据集相比,无约束驾驶视频存在诸多挑战。这表明RoadText-1K适用于阅读系统的研发,其鲁棒性足以被纳入驾驶辅助和自动驾驶等更复杂的下游任务中。该数据集可在 http://cvit.iiit.ac.in/research/projects/cvit-projects/roadtext-1k 获取。
引用
@article{arxiv.2005.09496,
title = {RoadText-1K: Text Detection & Recognition Dataset for Driving Videos},
author = {Sangeeth Reddy and Minesh Mathew and Lluis Gomez and Marcal Rusinol and Dimosthenis Karatzas. and C. V. Jawahar},
journal= {arXiv preprint arXiv:2005.09496},
year = {2020}
}
备注
to be published in ICRA 2020