基于多样性的轨迹与目标选择结合后见之明经验回放
机器学习
2021-11-10 v2 机器人学
摘要
后见之明经验回放(HER)是一种目标重标注技术,通常与离策略深度强化学习算法结合使用以解决面向目标的任务;它非常适用于仅提供稀疏奖励的机器人操作任务。在 HER 中,轨迹和转移都是均匀采样用于训练。然而,并非智能体的所有经验对训练的贡献都相等,因此朴素的均匀采样可能导致低效学习。在本文中,我们提出基于多样性的轨迹与目标选择结合 HER(DTGSH)。首先,根据由行列式点过程(DPPs)建模的目标状态的多样性对轨迹进行采样。其次,通过使用 k-DPPs 从轨迹中选择具有多样目标状态的转移。我们在模拟机器人环境中的五个具有挑战性的机器人操作任务上评估 DTGSH,结果表明我们的方法在所有任务上都能比其它最先进的方法学习得更快并达到更高的性能。
引用
@article{arxiv.2108.07887,
title = {Diversity-based Trajectory and Goal Selection with Hindsight Experience Replay},
author = {Tianhong Dai and Hengyan Liu and Kai Arulkumaran and Guangyu Ren and Anil Anthony Bharath},
journal= {arXiv preprint arXiv:2108.07887},
year = {2021}
}
备注
Pacific Rim International Conference on Artificial Intelligence, 2021