中文

微妙风险与关键故障:大语言模型具身决策物理安全诊断框架

人工智能 2025-05-27 v1

摘要

大型语言模型(LLMs)越来越多地被用于具身智能体的决策,然而现有的安全评估通常依赖于粗略的成功率和特定领域的设置,这使得很难诊断这些模型为何以及在何处失败。这掩盖了我们对具身安全的理解,并限制了在高风险物理环境中选择性部署 LLMs。我们引入了 SAFEL,这是一个系统评估具身决策中 LLMs 物理安全的框架。SAFEL 评估两项关键能力:(1)通过命令拒绝测试拒绝不安全命令,以及(2)通过计划安全测试生成安全且可执行的计划。关键的是,后者被分解为多个功能模块:目标解释、状态转移建模、动作排序,从而能够对安全故障进行细粒度诊断。为了支持这一框架,我们引入了 EMBODYGUARD,这是一个基于 PDDL 的基准,包含 942 个由 LLM 生成的场景,涵盖了公然恶意的指令和具有上下文危险的指令。对 13 个最先进的 LLMs 的评估表明,尽管模型通常能拒绝明显不安全的命令,但它们难以预见和缓解微妙的、情境性的风险。我们的结果突出了当前 LLMs 的关键局限性,并为在安全的具身推理中进行更有针对性的、模块化的改进提供了基础。

关键词

引用

@article{arxiv.2505.19933,
  title  = {Subtle Risks, Critical Failures: A Framework for Diagnosing Physical Safety of LLMs for Embodied Decision Making},
  author = {Yejin Son and Minseo Kim and Sungwoong Kim and Seungju Han and Jian Kim and Dongju Jang and Youngjae Yu and Chanyoung Park},
  journal= {arXiv preprint arXiv:2505.19933},
  year   = {2025}
}

备注

37 pages, 13 tables, 6 figures