面向自动驾驶的视觉语言模型reason-responsiveness评估框架——CARE Drive
人工智能
2026-02-18 v1 计算机视觉与模式识别
摘要
基础模型,包括视觉语言模型,正在自动驾驶中用于解释场景、推荐行动和生成自然语言解释。然而,现有的评估方法主要基于结果表现(如安全性和轨迹精度)进行评估,而未确定模型决策是否反映了人类相关的考虑因素。因此,尚不清楚此类模型生成的解释是否对应于真正的 reason-responsiveness 决策,还是仅仅是事后合理化。在安全关键领域,这一局限尤其重要,因为它可能会制造虚假的信心。为弥补这一差距,我们提出了 CARE Drive,即 Context Aware Reasons Evaluation for Driving(基于上下文感知的驾驶理由评估),一个用于评估视觉语言模型在自动驾驶中 reason-responsiveness 的模型无关框架。CARE Drive 通过在受控情境变化下比较基线与 reason 增强模型决策,以评估人类理由是否在决策行为中起因果影响。该框架采用两阶段评估过程。首先进行提示校准,以确保输出稳定。随后进行系统性情境扰动,以测量决策对人类理由(如安全裕度、社会压力和效率约束)的敏感性。我们在涉及竞争规范性考虑的自行车超车场景中展示了 CARE Drive。结果表明,显式的人类理由显著影响模型决策,提高了与专家建议行为的一致性。然而,reason-responsiveness 在不同情境因素之间存在差异,表明对不同类型理由的敏感性不均。这为在不修改模型参数的情况下系统性地评估基础模型的 reason-responsiveness 提供了实证依据。
引用
@article{arxiv.2602.15645,
title = {CARE Drive A Framework for Evaluating Reason-Responsiveness of Vision Language Models in Automated Driving},
author = {Lucas Elbert Suryana and Farah Bierenga and Sanne van Buuren and Pepijn Kooij and Elsefien Tulleners and Federico Scari and Simeon Calvert and Bart van Arem and Arkady Zgonnikov},
journal= {arXiv preprint arXiv:2602.15645},
year = {2026}
}
备注
21 pages, on submission to Transportation Research Part C