中文

AI 科学家的风险:优先考虑安全保障而非自主性

计算机与社会 2025-07-23 v5 人工智能 计算与语言 机器学习

摘要

由大语言模型驱动的 AI 科学家在自主进行实验和促进跨学科科学发现方面展现出了巨大的潜力。尽管它们的能力前景广阔,但这些智能体也引入了新的漏洞,需要为安全性进行仔细考量。然而,目前对这些漏洞的全面探索仍然有限。本视角探讨了 AI 科学家的漏洞,阐明了与其滥用相关的潜在风险,并强调了采取安全措施的必要性。我们首先概述了 AI 科学家固有的潜在风险,考虑了用户意图、特定科学领域及其对外部环境的潜在影响。然后,我们探讨了这些漏洞的根本原因,并对有限的现有工作进行了范围综述。基于我们的分析,我们提出了一个包含人类监管、智能体对齐和对环境反馈的理解(智能体监管)的三元框架,以减轻这些已识别的风险。此外,我们强调了保障 AI 科学家安全性的局限性与挑战,并倡导开发改进的模型、稳健的基准测试和全面的法规。

关键词

引用

@article{arxiv.2402.04247,
  title  = {Risks of AI Scientists: Prioritizing Safeguarding Over Autonomy},
  author = {Xiangru Tang and Qiao Jin and Kunlun Zhu and Tongxin Yuan and Yichi Zhang and Wangchunshu Zhou and Meng Qu and Yilun Zhao and Jian Tang and Zhuosheng Zhang and Arman Cohan and Zhiyong Lu and Mark Gerstein},
  journal= {arXiv preprint arXiv:2402.04247},
  year   = {2025}
}