AI 智能体道德价值对齐的混合方法:一项宣言
人工智能
2025-01-17 v3 计算机与社会
机器学习
多智能体系统
摘要
对确保下一代人工智能(AI)系统安全性的日益关注,呼唤将道德嵌入自主智能体的新方法。这一目标在性质上不同于传统的特定任务 AI 方法。在本文中,我们对将道德引入机器的现有方法进行了系统化梳理,并将其建模为一个连续体。分析表明,流行技术处于该连续体的两端——要么完全硬编码为自上而下的显式规则,要么完全以自下而上的隐式方式学习,而没有任何对道德原则的直接陈述(后者包括从人类反馈中学习,如应用于大语言模型或 LLM 的训练和微调)。鉴于每种方法各有其相对优势和劣势,本文论证了需要更多混合解决方案,以创建既适应性强且稳健,又可控且可解释的智能体系统。为此,本文讨论了道德对齐 AI 系统的伦理基础(包括义务论、后果论和美德伦理学)与实现。本文提出了一系列依赖于内在奖励、道德约束或文本指令的案例研究,并将其应用于纯强化学习或基于 LLM 的智能体。通过在同一框架下分析这些多样化的实现,本文比较了它们在开发道德对齐 AI 系统中的相对优势与不足。随后,本文讨论了评估道德学习智能体有效性的策略。最后,本文提出了由该混合框架衍生出的关于 AI 安全与伦理未来的开放性研究问题与启示。
引用
@article{arxiv.2312.01818,
title = {Hybrid Approaches for Moral Value Alignment in AI Agents: a Manifesto},
author = {Elizaveta Tennant and Stephen Hailes and Mirco Musolesi},
journal= {arXiv preprint arXiv:2312.01818},
year = {2025}
}