车道之间阅读:道路场景文本视频问答
计算机视觉与模式识别
2025-06-17 v2
摘要
道路周围的文本和标志为驾驶员提供关键信息,对安全导航和态势感知至关重要。运动中的场景文本识别是一个具有挑战性的问题,因为文本线索通常仅出现很短的时间,且需要在远距离处尽早检测。利用此类信息辅助驾驶员的系统不仅应从视频流中提取并融合视觉与文本线索,还应随时间进行推理。为解决该问题,我们引入了 RoadTextVQA,一个用于驾驶辅助背景下视频问答(VideoQA)任务的新数据集。RoadTextVQA 由从多个国家收集的 个驾驶视频组成,标注了 个问题,均基于驾驶视频中出现的文本或道路标志。我们在 RoadTextVQA 数据集上评估了 SOTA 视频问答模型的性能,凸显了该领域显著的改进潜力以及该数据集在推动车载辅助系统与文本感知多模态问答研究方面的有用性。数据集可在 http://cvit.iiit.ac.in/research/projects/cvit-projects/roadtextvqa 获取。
引用
@article{arxiv.2307.03948,
title = {Reading Between the Lanes: Text VideoQA on the Road},
author = {George Tom and Minesh Mathew and Sergi Garcia and Dimosthenis Karatzas and C. V. Jawahar},
journal= {arXiv preprint arXiv:2307.03948},
year = {2025}
}