中文

随机游走:无监督下学习发现并抵达目标

机器学习 2022-06-24 v1 人工智能 机器人学

摘要

通过与环境中交互而无任何外部监督地学习一组多样化技能是一个重要挑战。特别地,获得一个能够抵达任意给定状态的目标条件智能体在许多应用中都很有用。我们提出一种无需任何外部奖励或领域知识来训练此类目标条件智能体的新方法。我们使用随机游走训练一个预测两个状态间相似度的可达性网络。该可达性网络随后用于构建包含多样化且均衡的过往观测的目标记忆。最后,我们用从目标记忆中采样得到的目标训练一个目标条件策略网络,并通过可达性网络和目标记忆给予其奖励。随着智能体发现并学习新目标,所有组件在训练中保持更新。我们将方法应用于连续控制导航和机器人操作任务。

关键词

引用

@article{arxiv.2206.11733,
  title  = {Walk the Random Walk: Learning to Discover and Reach Goals Without Supervision},
  author = {Lina Mezghani and Sainbayar Sukhbaatar and Piotr Bojanowski and Karteek Alahari},
  journal= {arXiv preprint arXiv:2206.11733},
  year   = {2022}
}