多智能体强化学习中的善意机制
人工智能
2023-11-09 v1 机器学习
摘要
在人类社会中,人们常常在决策中纳入公平性,并通过善待那些友善行事的人来进行互惠。他们评估他人行为的善意不仅通过监测结果,还考虑意图。这一行为概念可被借鉴用于训练多智能体强化学习(MARL)中的协作智能体。我们提出 KindMARL 方法,其中智能体的意图通过对智能体可用动作的环境影响进行反事实推理来度量。更具体地说,将当前环境状态与假设该智能体选择另一动作时当前环境状态的估计进行比较。然后将每个智能体作为其动作结果的奖励与其同伴的奖励之差,乘以该同伴的意图,作为该同伴的“善意”。若每次奖励比较的结果确认该智能体占优,它便感知到同伴的善意并降低自身奖励。在 Cleanup 和 Harvest 环境中的实验结果表明,基于 KindMARL 方法的训练使智能体比基于 Inequity Aversion 和 Social Influence 方法的训练分别多获得 89%(相应为 37%)和 44%(相应为 43%)的总奖励。KindMARL 的有效性在交通灯控制问题的实验中得到进一步支持。
引用
@article{arxiv.2311.04239,
title = {Kindness in Multi-Agent Reinforcement Learning},
author = {Farinaz Alamiyan-Harandi and Mersad Hassanjani and Pouria Ramazi},
journal= {arXiv preprint arXiv:2311.04239},
year = {2023}
}
备注
arXiv admin note: text overlap with arXiv:2302.12053