中文

AI 智能体道德价值对齐的混合方法:一项宣言

人工智能 2025-01-17 v3 计算机与社会 机器学习 多智能体系统

摘要

对确保下一代人工智能(AI)系统安全性的日益关注,呼唤将道德嵌入自主智能体的新方法。这一目标在性质上不同于传统的特定任务 AI 方法。在本文中,我们对将道德引入机器的现有方法进行了系统化梳理,并将其建模为一个连续体。分析表明,流行技术处于该连续体的两端——要么完全硬编码为自上而下的显式规则,要么完全以自下而上的隐式方式学习,而没有任何对道德原则的直接陈述(后者包括从人类反馈中学习,如应用于大语言模型或 LLM 的训练和微调)。鉴于每种方法各有其相对优势和劣势,本文论证了需要更多混合解决方案,以创建既适应性强且稳健,又可控且可解释的智能体系统。为此,本文讨论了道德对齐 AI 系统的伦理基础(包括义务论、后果论和美德伦理学)与实现。本文提出了一系列依赖于内在奖励、道德约束或文本指令的案例研究,并将其应用于纯强化学习或基于 LLM 的智能体。通过在同一框架下分析这些多样化的实现,本文比较了它们在开发道德对齐 AI 系统中的相对优势与不足。随后,本文讨论了评估道德学习智能体有效性的策略。最后,本文提出了由该混合框架衍生出的关于 AI 安全与伦理未来的开放性研究问题与启示。

关键词

引用

@article{arxiv.2312.01818,
  title  = {Hybrid Approaches for Moral Value Alignment in AI Agents: a Manifesto},
  author = {Elizaveta Tennant and Stephen Hailes and Mirco Musolesi},
  journal= {arXiv preprint arXiv:2312.01818},
  year   = {2025}
}