中文

基于信息瓶颈的多智能体强化学习行为表示学习

机器学习 2021-09-30 v1 信息论 多智能体系统 math.IT

摘要

在多智能体深度强化学习中,提取其他智能体充分且紧凑的信息对于实现算法的高效收敛和可扩展性至关重要。在经典框架中,此类信息的提炼通常以隐式且不可解释的方式完成,或者显式地使用无法反映表示中信息压缩与效用之间关系的代价函数来完成。本文提出了基于信息瓶颈的多智能体强化学习其他智能体行为表示学习(IBORM),以显式寻求低维映射编码器,通过该编码器建立与其他智能体行为相关的紧凑且信息丰富的表示。IBORM 利用信息瓶颈原理压缩观测信息,同时保留用于协作决策的与其他智能体行为相关的充分信息。实验结果表明,与隐式行为表示学习以及未显式考虑信息压缩与效用的显式行为表示学习相比,IBORM 具有最快的收敛速度和最优的学习策略性能。

关键词

引用

@article{arxiv.2109.14188,
  title  = {Information-Bottleneck-Based Behavior Representation Learning for Multi-agent Reinforcement learning},
  author = {Yue Jin and Shuangqing Wei and Jian Yuan and Xudong Zhang},
  journal= {arXiv preprint arXiv:2109.14188},
  year   = {2021}
}