中文

用多智能体强化学习建模社会困境中的道德选择

多智能体系统 2023-08-31 v3 人工智能 机器学习

摘要

人工智能(AI)在现实世界中的实际运用已表明将道德选择嵌入智能体的重要性。这也凸显出依据任一类型道德自上而下定义 AI 伦理约束极为困难且可能带来风险。自下而上的学习路径可能更适于研究与开发 AI 智能体的伦理行为。特别地,我们认为一个有趣且富有洞见的起点是:分析在社会困境中依据一组预定义道德奖励行事的强化学习(RL)智能体的涌现行为。在本工作中,我们对基于道德理论获得奖励的内在动机 RL 智能体所做出的选择进行系统分析。我们旨在设计简化却具代表性地体现一组关键伦理体系的奖励结构。因此,我们首先定义区分基于后果与基于规范、基于社会规范或内在美德、以及单一与混合美德(如多目标)方法的道德奖励函数。随后,我们通过建模三个迭代社会困境博弈(囚徒困境、志愿者困境与猎鹿博弈)中学习型道德智能体间的重复两两交互来评估我们的方法。我们分析了不同类型道德对合作、背叛或剥削之涌现及相应社会结果的影响。最后,我们讨论了这些发现对人工及人机混合社会中道德智能体开发的启示。

关键词

引用

@article{arxiv.2301.08491,
  title  = {Modeling Moral Choices in Social Dilemmas with Multi-Agent Reinforcement Learning},
  author = {Elizaveta Tennant and Stephen Hailes and Mirco Musolesi},
  journal= {arXiv preprint arXiv:2301.08491},
  year   = {2023}
}

备注

Accepted at IJCAI 2023 (32nd International Joint Conference on Artificial Intelligence - Macao, S.A.R.)