AI 对齐中的镜像神经元模式
人工智能
2025-11-06 v2 机器学习
神经元与认知
摘要
随着人工智能(AI)向超人类能力迈进,对这些系统与人类价值观的对齐变得日益关键。当前的对齐策略主要依赖于外部指定的约束,可能在面对能够规避顶级控制的超智能 AI 时证明不足。本研究探讨人工神经网络(ANN)是否可以发展出类似生物镜像神经元细胞的模式——这些细胞在执行和观察动作时都会激活——以及这些模式如何可能为 AI 系统的内在对齐贡献。镜像神经元在人类同情心、模仿和社会认知中起关键作用。因此,本研究提出了两个问题:(1) 简单的 ANN 是否可以发展出镜像神经元模式?(2) 这些模式如何有助于 AI 系统在伦理和合作决策方面?我们提出一种新颖的青蛙与青蛇游戏框架,以促进合作行为,识别镜像神经元模式出现的条件,评估其对动作电路的影响,提出 Checkpoint Mirror Neuron Index(CMNI)来量化激活强度和一致性,并提出进一步研究的理论框架。我们的发现表明,适当规模的模型容量和自我/他人耦合可在 ANN 中培育出类似生物镜像神经元的共享神经表征。这些类似同情心的电路支持合作行为,表明通过镜像神经元动态实现的内在动机可能通过在 AI 架构中内嵌同情心机制来补充现有的对齐技术。
引用
@article{arxiv.2511.01885,
title = {Mirror-Neuron Patterns in AI Alignment},
author = {Robyn Wyrick},
journal= {arXiv preprint arXiv:2511.01885},
year = {2025}
}
备注
51 pages, Masters thesis. 10 tables, 7 figures, project data & code here: https://github.com/robynwyrick/mirror-neuron-frog-and-toad