通过多样性感知红队化揭示视觉语言动作模型中的语言脆弱性
机器人学
2026-04-08 v1 计算机视觉与模式识别
摘要
视觉语言动作 (VLA) 模型在机器人操作中取得了显著的成功。然而,它们对语言细微差别的鲁棒性仍是一个关键且尚未充分探索的安全问题,这构成了向实际场景部署的重大安全风险。红队化,即识别会引发灾难性行为的环境情景,是确保具身 AI 智能体安全部署的重要步骤。强化学习 (RL) 作为自动化红队化的有前景方法,旨在揭示这些漏洞。然而,基于标准 RL 的对手往往因其奖励最大化的本性而 suffer 严重的模式坍缩,这倾向于收敛到狭窄的平凡或重复的失效模式,未能揭示有意义风险的综合图景。为弥合这一差距,我们提出了一种 novel 框架——**D**iversity-**A**ware **E**mbodied **R**ed **T**eaming (**DAERT**),以暴露 VLA 对语言变化的脆弱性。我们的设计基于评估统一策略,该策略能够生成多样化的具挑战性指令,同时确保其攻击有效性——即在物理模拟器中测量执行失败。我们在不同机器人基准上针对两种最先进的 VLA(包括 和 OpenVLA)进行大规模实验。我们的方法一致发现更广泛的更有效对抗指令,将平均任务成功率从 93.33% 降至 5.85%,展示了一种可扩展的应力测试 VLA 智能体、在实际部署前暴露关键安全盲点的做法。
引用
@article{arxiv.2604.05595,
title = {Uncovering Linguistic Fragility in Vision-Language-Action Models via Diversity-Aware Red Teaming},
author = {Baoshun Tong and Haoran He and Ling Pan and Yang Liu and Liang Lin},
journal= {arXiv preprint arXiv:2604.05595},
year = {2026}
}