DisTop:发现一种拓扑表示以学习多样且有回报的技能
机器学习
2021-06-09 v1
摘要
深度强化学习(DRL)智能体探索的最优方式是学习一组实现状态均匀分布的技能。遵循此思路,我们提出 DisTop,一种同时学习多样技能并专注于改进有回报技能的新模型。DisTop 利用无监督对比损失、增长网络和目标条件策略逐步构建环境的离散拓扑。借助该拓扑,状态无关的分层策略可选择智能体需在状态空间中持续发现技能的位置。反过来,新访问的状态改善了学习到的表示,学习循环得以继续。我们的实验强调 DisTop 对底层状态表示具有不变性,且无论状态是高维二值数据、图像还是本体感受输入,智能体都能发现其环境的拓扑。我们证明该范式在 MuJoCo 基准上,在单任务稠密奖励和多样技能发现两方面均与最先进算法具有竞争力。通过结合这两个方面,我们表明在奖励稀疏时,DisTop 相比分层强化学习(HRL)取得了最先进的性能。我们相信 DisTop 通过展示自下而上的技能发现与表示学习相结合能够破解 DRL 中的探索难题,开辟了新视角。
引用
@article{arxiv.2106.03853,
title = {DisTop: Discovering a Topological representation to learn diverse and rewarding skills},
author = {Arthur Aubret and Laetitia matignon and Salima Hassas},
journal= {arXiv preprint arXiv:2106.03853},
year = {2021}
}