DAVE:面向复杂不可预测环境中以脆弱道路用户为高代表性的多样化原子级视觉要素数据集
计算机视觉与模式识别
2024-12-31 v1
摘要
大多数现有交通视频数据集(包括Waymo)结构化,主要聚焦于西方交通场景,限制了其全球适用性。具体而言,大多数亚洲场景更为复杂,涉及众多具有不同运动和行为特征的物体。在此基础上,我们提出一种新型数据集DAVE,旨在用于评估在复杂不可预测环境中以脆弱道路用户(VRUs:如行人、动物、摩托车和自行车等)为高代表性的感知方法。DAVE是一个手动标注的数据集,包含16种多样化的演员类别(涵盖动物、人类、车辆等)和16种动作类型(如切线、Z字形运动、U型掉头等复杂且罕见的情况),这些情形需要高度的推理能力。DAVE对超过1300万个边界框(bboxes)进行演员识别标注,超过160万个边界框同时标注了演员识别及其动作/行为细节。DAVE中的视频基于广泛的因素收集,包括天气条件、时间、道路场景和交通密度等。DAVE可用于评估跟踪、检测、时空动作定位、语言-视觉时刻检索和多标签视频动作识别等视频任务。鉴于准确识别脆弱道路用户对于预防事故和确保道路安全的重要性,在DAVE中,脆弱道路用户占比达41.13%,而Waymo中仅为23.71%。DAVE为开发更敏感和准确的视觉感知算法提供了宝贵资源。我们的实验表明,现有方法在评估DAVE时表现下降,凸显了其为未来视频识别研究所带来的益处。
引用
@article{arxiv.2412.20042,
title = {DAVE: Diverse Atomic Visual Elements Dataset with High Representation of Vulnerable Road Users in Complex and Unpredictable Environments},
author = {Xijun Wang and Pedro Sandoval-Segura and Chengyuan Zhang and Junyun Huang and Tianrui Guan and Ruiqi Xian and Fuxiao Liu and Rohan Chandra and Boqing Gong and Dinesh Manocha},
journal= {arXiv preprint arXiv:2412.20042},
year = {2024}
}