中文

AutoTrust:面向自动驾驶大型视觉语言模型可信度的基准测试

计算机视觉与模式识别 2024-12-20 v1

摘要

近期大型视觉语言模型(VLM)在针对自动驾驶(AD)领域取得显著进展,展现出强大的场景理解与推理能力,堪称端到端驾驶系统的有力候选人。然而,针对 DriveVLM 可信度的研究仍寥寥,此因素直接影响公共交通安全。本文我们引入 AutoTrust,作为大型视觉语言模型在自动驾驶场景下可信度的全面基准测试,涵盖信任性、安全性、鲁棒性、隐私性与公平性等多维视角。我们构建了规模最大的视觉问答数据集,用于调查驾驶场景中的可信度问题,包含超过 1 万个独立场景和 1.8 万个查询。我们评估了六个公开可用的 VLM,涵盖从通用型到专用型、从开源到商业模型。我们的详尽评估揭示了 DriveVLM 面临previously undiscovered 可信度威胁的漏洞。具体而言,我们发现像 LLaVA-v1.6 和 GPT-4o-mini 等通用 VLM 在总体可信度方面意外地优于为驾驶任务微调的专用模型。DriveVLM 如 DriveLM-Agent 在披露敏感信息方面尤其脆弱。此外,无论是通用型还是专用型 VLM 都容易受到对抗性攻击,且在确保不同环境和人群的公平决策方面仍存在挑战。我们的发现呼吁立即且果断地行动,以应对 DriveVLM 的可信度问题——这一对公共安全以及依赖自动交通系统的公众福祉至关重要。我们将发布全部代码与数据集于 https://github.com/taco-group/AutoTrust。

关键词

引用

@article{arxiv.2412.15205,
  title  = {FlowAR: Scale-wise Autoregressive Image Generation Meets Flow Matching},
  author = {Sucheng Ren and Qihang Yu and Ju He and Xiaohui Shen and Alan Yuille and Liang-Chieh Chen},
  journal= {arXiv preprint arXiv:2412.15205},
  year   = {2024}
}