中文

AI 安全是什么?我们希望它是什么?

计算机与社会 2025-05-06 v1 人工智能

摘要

AI 安全领域旨在防止或减少 AI 系统造成的伤害。一个简单且引人注目的 AI 安全是什么的观点认为,这一特征是构成性的:仅当其旨在防止或减少 AI 系统造成的伤害时,研究项目才属于 AI 安全的范围内。我们称此为“安全观”。尽管其简单易懂且具吸引力,但我们认为“安全观”至少与 AI 安全研究者和组织如何思考和讨论 AI 安全的两个趋势相冲突:首先,一种将 AI 安全研究的目标表述为来自未来系统的灾难性风险;其次,越来越流行的观点认为 AI 安全可被视为安全工程的一个分支。我们采用概念工程的方法,认为这些趋势都不妥:当我们考虑最理想的 AI 安全概念时,有充分理由认为“安全观”是答案。描述性地,“安全观”帮助我们看见,历史上被视为 AI 安全领域核心议题的工作,与被视为边缘议题(如偏见、误导和隐私)的工作是连续的。规范性地,若严格落实“安全观”,则需基于其实际价值,而非以任意方式在工作之间划出界限。

关键词

引用

@article{arxiv.2505.02313,
  title  = {What Is AI Safety? What Do We Want It to Be?},
  author = {Jacqueline Harding and Cameron Domenico Kirk-Giannini},
  journal= {arXiv preprint arXiv:2505.02313},
  year   = {2025}
}