中文

绝不向漏洞妥协:AI 治理综合综述

密码学与安全 2025-08-19 v4

摘要

人工智能(AI)的快速发展扩展了其在各领域的能力,但也引入了关键的技术漏洞,如算法偏见和对抗敏感性,这些漏洞带来了重大的社会风险,包括错误信息、不公平、安全漏洞、人身伤害和公众信任侵蚀。这些挑战凸显了对稳健 AI 治理的迫切需求。我们提出了一个整合技术与社会维度的综合框架,围绕三个相互关联的支柱构建:内在安全(系统可靠性)、衍生安全(现实世界危害缓解)和社会伦理(价值对齐与问责)。我们的方法独特之处在于,它统一了技术方法、新兴评估基准和政策见解,以促进 AI 系统的透明度、问责制和信任。通过对 300 多项研究的系统回顾,我们确定了三个核心挑战:(1)泛化差距,即防御措施无法应对不断演变的威胁;(2)评估协议不足,忽视了现实世界的风险;(3)法规碎片化导致监管不一致。这些缺陷源于将治理视为事后补救,而非基础性设计原则,导致了被动、孤立的努力,未能解决技术完整性与社会信任之间的相互依赖性。为了克服这一点,我们提出了一个整合的研究议程,将技术严谨性与社会责任联系起来。我们的框架为研究人员、工程师和政策制定者提供了可操作的指导,以开发不仅稳健安全,而且符合伦理且值得公众信赖的 AI 系统。相关资源库可在 https://github.com/ZTianle/Awesome-AI-SG 获取。

关键词

引用

@article{arxiv.2508.08789,
  title  = {Never Compromise to Vulnerabilities: A Comprehensive Survey on AI Governance},
  author = {Yuchu Jiang and Jian Zhao and Yuchen Yuan and Tianle Zhang and Yao Huang and Yanghao Zhang and Yan Wang and Yanshu Li and Xizhong Guo and Yusheng Zhao and Jun Zhang and Zhi Zhang and Xiaojian Lin and Yixiu Zou and Haoxuan Ma and Yuhu Shang and Yuzhi Hu and Keshu Cai and Ruochen Zhang and Boyuan Chen and Yilan Gao and Ziheng Jiao and Yi Qin and Shuangjun Du and Xiao Tong and Zhekun Liu and Yu Chen and Xuankun Rong and Rui Wang and Yejie Zheng and Zhaoxin Fan and Murat Sensoy and Hongyuan Zhang and Pan Zhou and Lei Jin and Hao Zhao and Xu Yang and Jiaojiao Zhao and Jianshu Li and Joey Tianyi Zhou and Zhi-Qi Cheng and Longtao Huang and Zhiyi Liu and Zheng Zhu and Jianan Li and Gang Wang and Qi Li and Xu-Yao Zhang and Yaodong Yang and Mang Ye and Wenqi Ren and Zhaofeng He and Hang Su and Rongrong Ni and Liping Jing and Xingxing Wei and Junliang Xing and Massimo Alioto and Shengmei Shen and Petia Radeva and Dacheng Tao and Ya-Qin Zhang and Shuicheng Yan and Chi Zhang and Zhongjiang He and Xuelong Li},
  journal= {arXiv preprint arXiv:2508.08789},
  year   = {2025}
}

备注

25 pages, 3 figures