中文

基于共情学习平衡利他主义与自身利他的算法

人工智能 2025-01-22 v2

摘要

现实的多主体场景往往涉及混合动机,要求具备自我保护能力的利他主义代理人。然而,现有方法往往难以同时实现这两个目标。本文基于共情反应受代理人之间推断社会关系影响的事实,提出了 LASE(Learning to balance Altruism and Self-interest based on Empathy,学习基于共情平衡利他主义与自身利他)分布式多主体强化学习算法,通过礼物促进利他合作,同时避免其他代理人在混合动机游戏中的剥削。在 LASE 中,奖励的一部分被分配给同伴作为礼物,该分配根据社会关系动态调整——这是一种衡量同伴友好程度的指标,通过反事实推理估计。具体而言,社会关系通过比较当前联合动作的估计 QQ 函数与对抗基线(即消除该同伴动作的联合动作 QQ 函数估计)来衡量每位同伴的友好程度,该联合动作分布由从视角迁移模块推断。进行了在空间和时间扩展的混合动机游戏中的全面实验,展示了 LASE 在不损害公平性的前提下促进团队合作的能力,以及其适应各种交互同伴策略的能力。

关键词

引用

@article{arxiv.2410.07863,
  title  = {Learning to Balance Altruism and Self-interest Based on Empathy in Mixed-Motive Games},
  author = {Fanqi Kong and Yizhe Huang and Song-Chun Zhu and Siyuan Qi and Xue Feng},
  journal= {arXiv preprint arXiv:2410.07863},
  year   = {2025}
}