DRAMA-X:面向驾驶的细粒度意图预测与风险推理基准
计算机视觉与模式识别
2025-08-12 v2 人工智能
机器人学
摘要
理解易碎道路使用者(VRUs)如行人和骑行者的短期运动对于安全的自动驾驶尤为关键,尤其是在包含歧义或高风险行为的城市场景中。虽然视觉语言模型(VLMs)已实现开放词汇感知,但其在细粒度意图推理方面的实用性仍未得到充分探索。值得注意的是,现有基准尚未评估在安全关键情境下的多类意图预测。为填补这一空白,我们引入 DRAMA-X,一个由 DRAMA 数据集通过自动标注管道构建的细粒度基准。DRAMA-X 包含 5,686 个事故易发帧,标注了目标边界框、九类方向意图分类、二进制风险评分、专家生成的车主动作建议,以及描述性运动摘要。这些标注使得对四个相互关联的自主决策核心任务进行结构化评估成为可能:目标检测、意图预测、风险评估和动作建议。作为参考基线,我们提出了 SGG-Intent,一个轻量级、无训练的框架,模拟车主的推理流程:它使用基于 VLM 的检测器从视觉输入依次生成场景图谱,推断意图,评估风险,并通过由大型语言模型驱动的组合推理阶段生成动作建议。我们评估了一系列最新的 VLMs,比较了在所有四个 DRAMA-X 任务中的性能。我们的实验表明,基于场景图谱的推理在意图预测和风险评估方面表现出色,尤其是在显式建模情境线索时。
引用
@article{arxiv.2506.17590,
title = {DRAMA-X: A Fine-grained Intent Prediction and Risk Reasoning Benchmark For Driving},
author = {Mihir Godbole and Xiangbo Gao and Zhengzhong Tu},
journal= {arXiv preprint arXiv:2506.17590},
year = {2025}
}
备注
19 pages, 5 figures, Preprint under review. Code available at: https://github.com/taco-group/DRAMA-X