VLSA:带即插即用安全约束层的视觉-语言-动作模型
机器人学
2025-12-16 v1 系统与控制
系统与控制
摘要
视觉-语言-动作(VLA)模型在跨多样化机器人操控任务的泛化能力方面已展现出显著优势。然而,在非结构化环境中部署这些模型仍面临挑战,因为需要同时保证任务合规与安全,尤其在物理交互过程中防止潜在碰撞。在本工作中,我们提出了一种视觉-语言-安全动作(VLSA)架构——AEGIS,其中包含一个通过控制障碍函数制定的即插即用安全约束层。AEGIS可直接与现有VLA模型集成,在保持理论保证的前提下提升安全性,同时维持其原有的指令遵循性能。为评估我们架构的有效性,我们构建了一个全面的安全关键基准数据集SafeLIBERO,涵盖具有不同程度空间复杂性和障碍物干预的操控场景。大量实验证明我们的方法优于现有最先进基线。值得注意的是,AEGIS在障碍物规避率上实现了59.16%的提升,同时任务执行成功率大幅提高了17.25%。为促进可复现性和未来研究,我们公开了代码、模型和基准数据集,地址为 https://vlsa-aegis.github.io/。
引用
@article{arxiv.2512.11891,
title = {VLSA: Vision-Language-Action Models with Plug-and-Play Safety Constraint Layer},
author = {Songqiao Hu and Zeyi Liu and Shuang Liu and Jun Cen and Zihan Meng and Xiao He},
journal= {arXiv preprint arXiv:2512.11891},
year = {2025}
}
备注
20 pages, 14 figures