通过最大化基于状态-动作的互信息发现深度强化学习中的多样解
机器学习
2022-04-14 v2 人工智能
机器学习
摘要
强化学习算法通常仅限于为指定任务学习单一解,尽管往往存在多样的解。近期研究表明,学习一组多样的解是有益的,因为多样性可实现鲁棒的少样本适应。尽管现有方法利用互信息作为无监督奖励来学习多样解,但这种方法常受限于由值函数近似引起的梯度估计器偏差。在本研究中,我们提出一种新方法,能够学习多样解而不受该偏差问题影响。在我们的方法中,以连续或离散潜变量为条件的策略通过直接最大化互信息的变分下界进行训练,而非如先前研究那样将互信息用作无监督奖励。通过在机器人运动任务上的大量实验,我们证明所提方法通过学习的连续潜变量成功学习到无限集的多样解,这比学习有限数量的解更具挑战性。随后,我们表明我们的方法相比现有方法可实现更有效的少样本适应。
引用
@article{arxiv.2103.07084,
title = {Discovering Diverse Solutions in Deep Reinforcement Learning by Maximizing State-Action-Based Mutual Information},
author = {Takayuki Osa and Voot Tangkaratt and Masashi Sugiyama},
journal= {arXiv preprint arXiv:2103.07084},
year = {2022}
}
备注
35 pages