中文

面向AI安全的神经AI

人工智能 2025-04-04 v2 机器学习

摘要

随着AI系统变得越来越强大,AI安全的需求变得越来越迫切。人类作为AI安全的模型具有吸引力:作为唯一已知具备通用智能的代理人,他们即使在显著偏离先前经验的条件下,仍能表现出鲁棒性,安全地探索世界,理解语用学,并能够合作实现内在目标。当智能结合合作与安全机制时,便可驱动持久的进步与福祉。这类属性是大脑结构及其实现的学习算法的函数。因此,神经科学可能持有当前未被充分探索和利用的技术AI安全的重要钥匙。本路线图概述并批判性地评估了几条受神经科学启发的AI安全路径:模拟大脑的表征、信息处理与结构;从模仿大脑数据与身体构建鲁棒的感知与运动系统;基于大脑数据进行精调;使用神经科学方法推进可解释性;以及扩展认知启发的架构。我们提出了若干具体建议,阐明神经科学如何积极影响AI安全。

关键词

引用

@article{arxiv.2411.18526,
  title  = {NeuroAI for AI Safety},
  author = {Patrick Mineault and Niccolò Zanichelli and Joanne Zichen Peng and Anton Arkhipov and Eli Bingham and Julian Jara-Ettinger and Emily Mackevicius and Adam Marblestone and Marcelo Mattar and Andrew Payne and Sophia Sanborn and Karen Schroeder and Zenna Tavares and Andreas Tolias and Anthony Zador},
  journal= {arXiv preprint arXiv:2411.18526},
  year   = {2025}
}

备注

152 pages, 22 figures