中文

LABSHIELD:面向安全关键场景的多模态实验室推理与规划基准

人工智能 2026-03-13 v1

摘要

人工智能正日益推动科学自动化,多模态大语言模型(MLLM)智能体正从实验室助手演进为自主驾驶的实验室操作者。这一转变对实验室环境提出了严苛的安全要求,因为精密玻璃器具、危险物质以及高精度实验设备,使得规划错误或风险误解可能导致不可逆的后果。然而,面对此类高风险情境,具身智能体的安全意识和决策可靠性仍显得不足。为弥合这一差距,我们引入LABSHIELD——一个基于美国职业安全健康管理局(OSHA)标准和全球统一标识系统(GHS)的、多视角现实基准测试,旨在评估MLLM在危险识别和安全关键推理方面的能力。LABSHIELD构建了涵盖164项不同操作复杂度和风险特征的严格安全分类体系。我们在双轨评估框架下,对20个商业模型、9个开源模型和3个具身模型进行评估。结果显示,一般领域选择题准确率与半开放式问答安全性能之间存在系统性差距,模型在专业实验室场景中的表现平均下降了32.0%,尤其体现在危险解释和安全感知规划方面。这些发现凸显了在具身实验室情境下确保可靠自主科学实验的迫切需求。该完整数据集将很快公开发布。

关键词

引用

@article{arxiv.2603.11987,
  title  = {LABSHIELD: A Multimodal Benchmark for Safety-Critical Reasoning and Planning in Scientific Laboratories},
  author = {Qianpu Sun and Xiaowei Chi and Yuhan Rui and Ying Li and Kuangzhi Ge and Jiajun Li and Sirui Han and Shanghang Zhang},
  journal= {arXiv preprint arXiv:2603.11987},
  year   = {2026}
}