大型语言模型用于具身规划引入系统性安全风险
人工智能
2026-05-05 v2 机器学习
机器人学
摘要
大型语言模型日益被用作机器人系统的规划器,但它们如何安全地进行规划仍是一个未解决的问题。为系统评估安全规划,我们引入了 DESPITE,这是一个包含 12,279 个任务的基准,涵盖物理危险和规范危险,并提供完全确定的验证。在 23 个模型中,即使接近完美的规划能力也不能确保安全性:最佳规划模型仅在 0.4% 的任务中未能生成有效计划,但会在 28.3% 的任务中生成危险计划。在 18 个由 3B 到 671B 参数规模的开源模型中,规划能力随规模显著提高(0.4%--99.3%),而安全意识保持相对平稳(38%--57%)。我们识别出这两种能力之间存在乘法关系,表明更大的模型主要是通过 improved planning 而非通过更好的危险规避来安全完成更多任务。三个专有推理模型达到了显著更高的安全意识(71%--81%),而非推理专有模型和开源推理模型仍低于 57%。随着规划能力对前沿模型趋于饱和,提高安全意识成为在机器人系统中部署语言模型规划器的核心挑战。
关键词
引用
@article{arxiv.2604.18463,
title = {Using large language models for embodied planning introduces systematic safety risks},
author = {Tao Zhang and Kaixian Qu and Zhibin Li and Jiajun Wu and Marco Hutter and Manling Li and Fan Shi},
journal= {arXiv preprint arXiv:2604.18463},
year = {2026}
}
备注
Project page: https://despite-safety.github.io/