借助神经自我-他人重叠实现安全可靠的AI代理
人工智能
2024-12-24 v1 密码学与安全
摘要
随着AI系统在关键决策中的作用日益增长,欺骗性AI对信任与安全构成了严峻挑战。我们提出了自我-他人重叠(Self-Other Overlap, SOO)微调方法,这是一种具有前景的AI安全技术,能够显著提升构建诚实人工智能的能力。我们受认知神经科学中关于同理心研究的启发,SOO旨在对齐AI模型对自身与他人所代表的内在表示。我们的实验表明,SOO在参数为7B、27B和78B的大型语言模型上均显示出良好的效果:Mistral-7B-Instruct-v0.2中欺骗性回应比例从73.6%降至17.2%,且未观察到一般任务性能的下降;在Gemma-2-27b-it和CalmeRys-78B-Orpo-v0.1中,欺骗性回应分别从100%降至9.3%和2.7%,且仅对能力产生轻微影响。在强化学习情境中,SOO训练的代理器显著减少了欺骗行为。SOO通过对比自我与他人引用的观察,具有强大的跨AI架构泛化潜力。虽然当前应用主要聚焦于语言模型和简单强化学习环境,但SOO为更广泛领域的可信AI铺平了道路。伦理影响和长期效应需要进一步探讨,但SOO代表了AI安全研究的重要进步。
引用
@article{arxiv.2412.16325,
title = {Towards Safe and Honest AI Agents with Neural Self-Other Overlap},
author = {Marc Carauleanu and Michael Vaiana and Judd Rosenblatt and Cameron Berg and Diogo Schwerz de Lucena},
journal= {arXiv preprint arXiv:2412.16325},
year = {2024}
}
备注
NeurIPS 2024 Safe Generative AI Workshop