LabSafety Bench:面向科学实验室安全问题的 LLM 基准测试
计算与语言
2026-02-13 v4 机器学习
摘要
人工智能(AI)正在 revolutionize 科学研究,但其日益增长的集成到实验室环境中 presents critical safety challenges。大语言模型(LLM)和视觉语言模型(VLM)现在正在帮助实验设计和程序指导,但其“理解错觉”可能导致研究人员对不安全的输出产生过度信任。我们展示了当前模型距离满足安全实验操作所需的可靠性仍有很长的路要走。我们引入了 LabSafety Bench,一个综合性的基准测试,用于评估模型在 765 个多选题和 404 个真实实验场景中进行危害识别、风险评估和后果预测,涵盖 3,128 个开放式任务。对 19 个先进 LLM 和 VLM 的评估显示,针对危害识别没有任何模型的准确率超过 70%。尽管专有模型在结构化评估中表现良好,但在开放式推理中并不显示出明显优势。这些结果凸显了在将 AI 系统部署到实际实验室环境中之前,亟需建立专门的安全评估框架的紧迫性。
关键词
引用
@article{arxiv.2410.14182,
title = {LabSafety Bench: Benchmarking LLMs on Safety Issues in Scientific Labs},
author = {Yujun Zhou and Jingdong Yang and Yue Huang and Kehan Guo and Zoe Emory and Bikram Ghosh and Amita Bedar and Sujay Shekar and Zhenwen Liang and Pin-Yu Chen and Tian Gao and Werner Geyer and Nuno Moniz and Nitesh V Chawla and Xiangliang Zhang},
journal= {arXiv preprint arXiv:2410.14182},
year = {2026}
}
备注
Published at Nature Machine Intelligence