中文

SafetyALFRED:评估多模态大语言模型的安全感知规划

人工智能 2026-04-22 v1 计算与语言 机器人学

摘要

多模态大语言模型正越来越多地被用作交互式环境中的自主智能体,但其主动应对安全隐患的能力仍然不足。我们引入了 SafetyALFRED,它建立在具身智能体基准 ALFRED 之上,并扩充了六类真实世界的厨房危险。现有的安全评估侧重于通过非具身问答(QA)设置进行危险识别,而我们不仅评估危险识别,还评估通过具身规划进行主动风险缓解,测试了来自 Qwen、Gemma 和 Gemini 家族的 11 个 SOTA 模型。我们的实验结果揭示了一个显著的对齐差距:虽然模型能在 QA 设置中准确识别危险,但相比之下,这些危险的平均缓解成功率较低。我们的研究结果表明,通过 QA 进行的静态评估不足以保证物理安全,因此我们提倡向优先考虑具身情境下纠正动作的基准进行范式转变。我们在 https://github.com/sled-group/SafetyALFRED.git 下开源了我们的代码和数据集。

关键词

引用

@article{arxiv.2604.19638,
  title  = {SafetyALFRED: Evaluating Safety-Conscious Planning of Multimodal Large Language Models},
  author = {Josue Torres-Fonseca and Naihao Deng and Yinpei Dai and Shane Storks and Yichi Zhang and Rada Mihalcea and Casey Kennington and Joyce Chai},
  journal= {arXiv preprint arXiv:2604.19638},
  year   = {2026}
}

备注

Work accepted at ACL 2026 Findings