Diversity Actor-Critic: 面向样本高效探索的样本感知熵正则化
机器学习
2021-06-10 v2 人工智能
机器学习
摘要
本文提出了样本感知策略熵正则化,以增强传统的策略熵正则化,从而实现更好的探索。利用可从经验回放池中获取的样本分布,所提出的样本感知熵正则化通过最大化策略动作分布与经验回放池样本动作分布加权和的熵,来实现样本高效的探索。通过将策略迭代应用于结合该样本感知熵正则化的目标函数,我们开发了一种名为 diversity actor-critic (DAC) 的实用算法。数值结果表明,DAC 在强化学习任务中显著优于现有的最新算法。
关键词
引用
@article{arxiv.2006.01419,
title = {Diversity Actor-Critic: Sample-Aware Entropy Regularization for Sample-Efficient Exploration},
author = {Seungyul Han and Youngchul Sung},
journal= {arXiv preprint arXiv:2006.01419},
year = {2021}
}
备注
Accepted to Proceedings of the 38th International Conference on Machine Learning