面向连续控制任务的集中式协同探索策略
机器学习
2023-01-09 v1
摘要
深度强化学习(DRL)算法在解决各类复杂控制任务上表现卓越。这一惊人成功部分归因于 DRL 鼓励智能体在训练过程中充分探索环境并收集多样化经验。因此,探索对于 DRL 获取最优策略起着重要作用。尽管近期工作在连续控制任务上取得重大进展,这些任务中的探索仍未被充分研究。为显式鼓励连续控制任务中的探索,我们提出 CCEP(Centralized Cooperative Exploration Policy,集中式协同探索策略),其利用价值函数的低估与高估来维持探索能力。CCEP 首先保留两个以不同参数初始化的价值函数,并从一对价值函数生成具有多种探索风格的多样化策略。此外,一个集中式策略框架确保 CCEP 实现多策略间的消息传递,进而有助于协同探索环境。大量实验结果表明,CCEP 实现了更高的探索能力。实证分析显示了 CCEP 所学策略中的多样化探索风格,在更多探索区域中获益。并且 CCEP 的这种探索能力确保其在实验中所示的多个连续控制任务上优于当前最先进(state-of-the-art)方法。
引用
@article{arxiv.2301.02375,
title = {Centralized Cooperative Exploration Policy for Continuous Control Tasks},
author = {Chao Li and Chen Gong and Qiang He and Xinwen Hou and Yu Liu},
journal= {arXiv preprint arXiv:2301.02375},
year = {2023}
}
备注
13 pages. Accepted by AAMAS 2023 (extended abstract). The presented document here is the full version of our paper