多智能体系统中利他主义与内在奖励的推断
计算机科学与博弈论
2025-11-05 v3
摘要
人类互动受情绪、性情和情感的影响,常常与个体的潜在偏好相冲突。在不明确了解这些偏好的情况下,判断行为是否恰当就变成了猜测,使我们极易产生误解。然而,如果自主智能体要与人类有效协作,这种理解至关重要。我们将此问题框架化为多智能体逆强化学习,并证明即使是一个简单的模型,即智能体在自身福利与他人福利之间进行权衡,也能涵盖广泛的社会行为。使用新颖的贝叶斯技术,我们发现通过将智能体置于不同的群体中,可以可靠地识别出内在奖励和利他倾向。至关重要的是,这种将内在动机与利他主义解耦的方法,使得即使演示来自受限的行为档案,也能合成与任何期望的利他主义水平相一致的新行为。
引用
@article{arxiv.2509.07650,
title = {Inference of Altruism and Intrinsic Rewards in Multi-Agent Systems},
author = {Victor Villin and Christos Dimitrakakis},
journal= {arXiv preprint arXiv:2509.07650},
year = {2025}
}
备注
EWRL18 (2025)