保留多样轨迹:促进连续控制中集成策略的探索
机器学习
2023-10-18 v1
摘要
深度强化学习(DRL)与集成方法的结合已被证明在解决复杂序列决策问题方面极为有效。这一成功主要归因于多个模型的利用,其增强了策略的鲁棒性与价值函数估计的准确性。然而,迄今为止对当前集成强化学习方法的经验性成功分析十分有限。我们的新分析揭示,先前的集成 DRL 算法的样本效率可能受到子策略多样性不足的制约。受这些发现的启发,本研究提出了一种称为轨迹感知集成探索(TEEN)的新集成 RL 算法。TEEN 的主要目标是在最大化期望回报的同时促进更多样化的轨迹。通过大量实验,我们证明与单独使用子策略相比,TEEN 不仅增强了集成策略的样本多样性,还提升了相对于集成 RL 算法的性能。平均而言,TEEN 在测试的代表性环境中性能优于基线集成 DRL 算法 41%。
引用
@article{arxiv.2310.11138,
title = {Keep Various Trajectories: Promoting Exploration of Ensemble Policies in Continuous Control},
author = {Chao Li and Chen Gong and Qiang He and Xinwen Hou},
journal= {arXiv preprint arXiv:2310.11138},
year = {2023}
}