中文

文化调谐的道德机器:通过逆强化学习使AI隐式学习人类价值系统

人工智能 2025-12-30 v1 计算机与社会 人机交互 机器学习

摘要

为人工智能构建普适的道德准则困难甚至不可能,因为不同人类文化对道德的定义和社会规范各不相同。因此,我们认为AI的价值系统应当具有文化调谐性:正如在特定文化中长大的儿童学习该文化的特定价值观和规范一样,我们提出,在特定人类社区中运行的AI智能体应当习得该社区的道德、伦理和文化准则。AI系统如何通过观察人类和与人类互动来获取这些准则,一直是一个悬而未决的问题。在此,我们提出使用逆强化学习(IRL)作为AI智能体隐式获取文化调谐价值系统的方法。我们通过一个实验范式测试了该方法:AI智能体使用IRL从不同文化群体在需要实时决策的在线虚拟世界中的行为中学习不同的奖励函数,这些奖励函数支配智能体的道德价值观。我们表明,从特定文化群体的平均行为中学习的AI智能体能够获得反映该群体行为的利他特征,并且这种习得的价值系统可以泛化到需要利他判断的新场景。据我们所知,我们的结果首次证明,AI智能体有可能被赋予通过观察和与人类互动持续学习其价值观和规范的能力,从而适应其运行所在的文化。

关键词

引用

@article{arxiv.2312.17479,
  title  = {Culturally-Attuned Moral Machines: Implicit Learning of Human Value Systems by AI through Inverse Reinforcement Learning},
  author = {Nigini Oliveira and Jasmine Li and Koosha Khalvati and Rodolfo Cortes Barragan and Katharina Reinecke and Andrew N. Meltzoff and Rajesh P. N. Rao},
  journal= {arXiv preprint arXiv:2312.17479},
  year   = {2025}
}