中文

确定性策略梯度算法的安全鲁棒经验共享

机器学习 2022-07-28 v1 人工智能

摘要

在高维连续任务中学习具有挑战性,主要是在经验回放内存非常有限时。我们为连续动作域中确定性策略引入了一种简单而有效的经验共享机制,用于未来经验回放缓冲区分配内存有限的离策略深度强化学习应用。为克服从其他智能体经验学习引起的外推误差,我们为算法配备了无需任何动作概率估计的新型离策略修正技术。我们在具有挑战性的 OpenAI Gym 连续控制任务中测试了方法的有效性,并得出结论:它能在多个智能体间实现安全的经验共享,并在回放内存严格受限时表现出鲁棒性能。

关键词

引用

@article{arxiv.2207.13453,
  title  = {Safe and Robust Experience Sharing for Deterministic Policy Gradient Algorithms},
  author = {Baturay Saglam and Dogan C. Cicek and Furkan B. Mutlu and Suleyman S. Kozat},
  journal= {arXiv preprint arXiv:2207.13453},
  year   = {2022}
}

备注

ICML 2022 Workshop on Responsible Decision Making in Dynamic Environments (poster: http://responsibledecisionmaking.github.io/assets/poster/19.pdf , presentation: http://drive.google.com/file/d/1vjjMh_z51xdOjsQCcGfU5ojAcrrf3dOS/view?usp=sharing )