PIMbot:社会困境中多机器人强化学习的策略与激励操纵
机器人学
2023-08-01 v1 机器学习
摘要
近期研究展示了强化学习(RL)在实现有效多机器人协作方面的潜力,尤其是在机器人面临自身利益与集体利益权衡的社会困境中。然而,误通信与对抗性机器人等环境因素会影响合作,因此探究如何操纵多机器人通信以实现不同结果至关重要。本文提出一种新方法,即 PIMbot,通过两种不同形式的操纵——策略操纵与激励操纵——来操纵多机器人协作中的奖励函数。我们的工作为近期利用独特奖励函数进行激励的多智能体 RL 社会困境中的操纵问题引入了新视角。借助所提 PIMbot 机制,机器人能够有效操纵社会困境环境。PIMbot 对任务结果具有积极与消极双重影响:积极影响可加快收敛至全局最优并为任意选定机器人最大化奖励;反之,消极影响会对整体任务性能产生有害作用。我们给出了在 Gazebo 仿真多机器人环境中的综合实验结果,证明了所提方法的有效性。我们的工作揭示了机器人间通信如何被操纵,并对各类机器人应用具有启示意义。
引用
@article{arxiv.2307.15944,
title = {PIMbot: Policy and Incentive Manipulation for Multi-Robot Reinforcement Learning in Social Dilemmas},
author = {Shahab Nikkhoo and Zexin Li and Aritra Samanta and Yufei Li and Cong Liu},
journal= {arXiv preprint arXiv:2307.15944},
year = {2023}
}
备注
Accepted at IROS2023