深度强化学习中的探索:从单智能体到多智能体领域
人工智能
2023-02-03 v6 机器学习
多智能体系统
摘要
深度强化学习(DRL)和深度多智能体强化学习(MARL)已在包括游戏AI、自动驾驶车辆、机器人等广泛领域中取得显著成功。然而,DRL和深度MARL智能体被广泛认为样本效率低下,即便对于相对简单的问题设定通常也需要数百万次交互,从而阻碍了在真实工业场景中的广泛应用与部署。其背后的一个瓶颈挑战是众所周知的探索问题,即如何高效地探索环境并收集有益于策略学习朝向最优策略的信息化经验。在具有稀疏奖励、噪声干扰、长时序和非平稳共同学习者的复杂环境中,该问题变得更具挑战性。本文对现有面向单智能体和多智能体RL的探索方法进行了全面综述。我们通过识别若干高效探索的关键挑战来展开综述。除上述两个主要分支外,我们还纳入了具有不同思想和技术其他值得注意的探索方法。除算法分析外,我们在一组常用基准上对不同DRL探索方法进行了全面且统一的实证比较。根据我们的算法和实证研究,我们最终总结了DRL和深度MARL中探索的开放问题,并指出了若干未来方向。
引用
@article{arxiv.2109.06668,
title = {Exploration in Deep Reinforcement Learning: From Single-Agent to Multiagent Domain},
author = {Jianye Hao and Tianpei Yang and Hongyao Tang and Chenjia Bai and Jinyi Liu and Zhaopeng Meng and Peng Liu and Zhen Wang},
journal= {arXiv preprint arXiv:2109.06668},
year = {2023}
}
备注
Accepted by IEEE Transactions on Neural Networks and Learning Systems (TNNLS)