中文

SafeScientist:迈向由 LLM 智能体实现的风险感知科学发现

人工智能 2025-05-30 v1

摘要

大型语言模型(LLM)智能体的最新进展显著加速了科学发现的自动化,但同时也引发了关键的伦理与安全担忧。为了系统地应对这些挑战,我们引入了 \textbf{SafeScientist},这是一个明确旨在增强 AI 驱动的科学探索中的安全性与伦理责任的创新型 AI 科学家框架。SafeScientist 主动拒绝伦理不当或高风险任务,并在整个研究过程中严格强调安全。为实现全面的安全监督,我们集成了多种防御机制,包括提示监控、智能体协作监控、工具使用监控以及伦理审查组件。作为 SafeScientist 的补充,我们提出了 \textbf{SciSafetyBench},这是一个专门设计用于评估科学背景下 AI 安全性的新型基准,包含跨 6 个领域的 240 个高风险科学任务,以及 30 个专门设计的科学工具和 120 个工具相关风险任务。大量实验表明,与传统 AI 科学家框架相比,SafeScientist 在不牺牲科学产出质量的情况下,将安全性能显著提升了 35\%。此外,我们严格验证了我们的安全流水线针对多种对抗攻击方法的鲁棒性,进一步证实了我们集成方法的有效性。代码和数据将可在 https://github.com/ulab-uiuc/SafeScientist 获取。\textcolor{red}{警告:本文包含可能具有冒犯性或有害的示例数据。}

关键词

引用

@article{arxiv.2505.23559,
  title  = {SafeScientist: Toward Risk-Aware Scientific Discoveries by LLM Agents},
  author = {Kunlun Zhu and Jiaxun Zhang and Ziheng Qi and Nuoxing Shang and Zijia Liu and Peixuan Han and Yue Su and Haofei Yu and Jiaxuan You},
  journal= {arXiv preprint arXiv:2505.23559},
  year   = {2025}
}