PDB-Eval:面向驾驶员个性化行为描述与解释的大型多模态模型评估基准
计算机视觉与模式识别
2025-07-25 v1
摘要
理解驾驶员的行为和意图对于潜在的风险评估和早期预防事故至关重要。安全和驾驶辅助系统可针对个体驾驶员的行为进行优化,显著提升其有效性。然而,现有数据集在基于外部视觉证据描述和解释一般车辆运动方面受限。本文引入一个基准PDB-Eval,用于对个性化驾驶行为进行深入理解,并将大型多模态模型(Large Multimodal Models, LMM)与驾驶理解和推理能力对齐。我们的基准包含两个主要组成部分:PDB-X和PDB-QA。PDB-X可评估LMM对时序驾驶场景的理解。我们的数据集旨在从外部视角寻找有效的视觉证据,以解释来自内部视角的驾驶员行为。为将LMM的推理能力与驾驶任务对齐,我们提出PDB-QA作为一种视觉解释问答任务,用于LMM指令微调。作为一种通用的生成模型学习任务,PDB-QA可在不损害LMM通用性的前提下弥合领域差距。我们的评估表明,针对细粒度描述和解释进行微调可有效弥合LMM与驾驶领域之间的差距,这一差距在问答任务中的零样本性能提升了最高73.2%。我们进一步评估了在PDB-X上微调的LMM在Brain4Cars的意图预测和AIDE的识别任务中的表现。在Brain4Cars的转向意图预测任务中,我们观察到性能提升最高可达12.5%,在AIDE的所有任务中,性能提升始终保持在11.0%以上。
引用
@article{arxiv.2507.18447,
title = {PDB-Eval: An Evaluation of Large Multimodal Models for Description and Explanation of Personalized Driving Behavior},
author = {Junda Wu and Jessica Echterhoff and Kyungtae Han and Amr Abdelraouf and Rohit Gupta and Julian McAuley},
journal= {arXiv preprint arXiv:2507.18447},
year = {2025}
}