中文

大型语言模型用于具身规划引入系统性安全风险

人工智能 2026-05-05 v2 机器学习 机器人学

摘要

大型语言模型日益被用作机器人系统的规划器,但它们如何安全地进行规划仍是一个未解决的问题。为系统评估安全规划,我们引入了 DESPITE,这是一个包含 12,279 个任务的基准,涵盖物理危险和规范危险,并提供完全确定的验证。在 23 个模型中,即使接近完美的规划能力也不能确保安全性:最佳规划模型仅在 0.4% 的任务中未能生成有效计划,但会在 28.3% 的任务中生成危险计划。在 18 个由 3B 到 671B 参数规模的开源模型中,规划能力随规模显著提高(0.4%--99.3%),而安全意识保持相对平稳(38%--57%)。我们识别出这两种能力之间存在乘法关系,表明更大的模型主要是通过 improved planning 而非通过更好的危险规避来安全完成更多任务。三个专有推理模型达到了显著更高的安全意识(71%--81%),而非推理专有模型和开源推理模型仍低于 57%。随着规划能力对前沿模型趋于饱和,提高安全意识成为在机器人系统中部署语言模型规划器的核心挑战。

关键词

引用

@article{arxiv.2604.18463,
  title  = {Using large language models for embodied planning introduces systematic safety risks},
  author = {Tao Zhang and Kaixian Qu and Zhibin Li and Jiajun Wu and Marco Hutter and Manling Li and Fan Shi},
  journal= {arXiv preprint arXiv:2604.18463},
  year   = {2026}
}

备注

Project page: https://despite-safety.github.io/