中文

多智能体系统中利他主义与内在奖励的推断

计算机科学与博弈论 2025-11-05 v3

摘要

人类互动受情绪、性情和情感的影响,常常与个体的潜在偏好相冲突。在不明确了解这些偏好的情况下,判断行为是否恰当就变成了猜测,使我们极易产生误解。然而,如果自主智能体要与人类有效协作,这种理解至关重要。我们将此问题框架化为多智能体逆强化学习,并证明即使是一个简单的模型,即智能体在自身福利与他人福利之间进行权衡,也能涵盖广泛的社会行为。使用新颖的贝叶斯技术,我们发现通过将智能体置于不同的群体中,可以可靠地识别出内在奖励和利他倾向。至关重要的是,这种将内在动机与利他主义解耦的方法,使得即使演示来自受限的行为档案,也能合成与任何期望的利他主义水平相一致的新行为。

关键词

引用

@article{arxiv.2509.07650,
  title  = {Inference of Altruism and Intrinsic Rewards in Multi-Agent Systems},
  author = {Victor Villin and Christos Dimitrakakis},
  journal= {arXiv preprint arXiv:2509.07650},
  year   = {2025}
}

备注

EWRL18 (2025)