通过非参数状态熵估计的策略梯度进行任务无关探索
机器学习
2021-03-02 v2 机器学习
摘要
在无奖励环境中,智能体应追求何种合适的内在目标才能学习到最优的任务无关探索策略?在本文中,我们论证了由有限时域轨迹诱导的状态分布的熵是一个合理的目标。特别地,我们提出了一种新颖且实用的策略搜索算法,即最大熵策略优化(Maximum Entropy POLicy optimization, MEPOL),用于学习最大化状态分布熵的非参数 近邻估计的策略。与已知方法相比,MEPOL 是完全无模型的,因为它既不需要估计任何策略的状态分布,也不需要对转移动力学进行建模。然后,我们凭经验表明,MEPOL 能够在高维连续控制领域学习到最大熵探索策略,并展示了该策略如何促进下游各种有意义的基于奖励任务的学习。
引用
@article{arxiv.2007.04640,
title = {Task-Agnostic Exploration via Policy Gradient of a Non-Parametric State Entropy Estimate},
author = {Mirco Mutti and Lorenzo Pratissoli and Marcello Restelli},
journal= {arXiv preprint arXiv:2007.04640},
year = {2021}
}
备注
In 35th AAAI Conference on Artificial Intelligence (AAAI 2021)