RefAV:面向以规划为中心的场景挖掘
计算机视觉与模式识别
2025-12-30 v3 计算与语言
机器人学
摘要
自动驾驶车辆(AVs)在正常车队测试期间收集并伪标注了数 TB 定位于高精地图的多模态数据。然而,从未整理的驾驶日志中识别有趣且安全关键的场景仍然是一个重大挑战。传统的场景挖掘技术容易出错且极其耗时,通常依赖手工设计的结构化查询。在这项工作中,我们通过最近视觉语言模型(VLMs)的视角重新审视时空场景挖掘,以检测驾驶日志中是否发生了所描述的场景,如果发生,则精确地在时间和空间上对其进行定位。为了解决这个问题,我们引入了 RefAV,这是一个包含 10,000 条多样化自然语言查询的大规模数据集,这些查询描述了源自 Argoverse 2 Sensor 数据集中 1000 条驾驶日志的、与运动规划相关的复杂多智能体交互。我们评估了几个指代性多目标跟踪器,并对我们的基线进行了实证分析。值得注意的是,我们发现简单地直接使用现成的 VLMs 会导致性能不佳,这表明场景挖掘带来了独特的挑战。最后,我们讨论了最近举办的比赛,并分享了来自社区的见解。我们的代码和数据集可在 https://github.com/CainanD/RefAV/ 和 https://argoverse.github.io/user-guide/tasks/scenario_mining.html 获取
引用
@article{arxiv.2505.20981,
title = {RefAV: Towards Planning-Centric Scenario Mining},
author = {Cainan Davidson and Deva Ramanan and Neehar Peri},
journal= {arXiv preprint arXiv:2505.20981},
year = {2025}
}
备注
Project Page: https://cainand.github.io/RefAV/