中文

揭示视觉语言模型的可解释失效模式

人工智能 2026-05-14 v1 机器学习 机器人学

摘要

视觉语言模型(VLMs)因其广泛的推理能力和最小化任务特定工程的泛化能力,日益被用于安全关键型应用。尽管具有这些优势,但在特定真实场景下会发生灾难性失效,构成失效模式。我们引入 REVELIO 框架,用于系统性地发现 VLMs 的可解释失效模式。我们将失效模式定义为可解释、领域相关概念(如行人靠近或不利天气条件)的组合,在这些概念下,目标 VLM 持续表现错误。识别此类失效模式需要搜索指数级离散组合空间。为解决此挑战,REVELIO 结合两种搜索程序:一种高效描绘失效景观的多样性感知光束搜索,以及一种启用复杂失效模式更广泛探索的高斯过程 Thompson 采样策略。我们将 REVELIO 应用于自动驾驶和室内机器人领域,发现了尚未报告的前沿 VLMs 漏洞。在驾驶环境中,模型常表现出弱空间定位,未能考虑重大障碍物,导致会产生模拟碰撞的建议。在室内机器人任务中,VLMs 要么错失安全危险,要么过于保守,产生误报并降低运行效率。通过识别结构化且可解释的失效模式,REVELIO 提供了可操作性见解,支持针对性性 VLM 安全改进。

关键词

引用

@article{arxiv.2605.12674,
  title  = {Revealing Interpretable Failure Modes of VLMs},
  author = {Isha Chaudhary and Vedaant V Jain and Kavya Sachdeva and Sayan Ranu and Gagandeep Singh},
  journal= {arXiv preprint arXiv:2605.12674},
  year   = {2026}
}