中文

通过对比学习发现强化学习中的层次化成就

机器学习 2023-11-03 v3 人工智能

摘要

在程序生成环境中发现具有层次结构的成就是一项重大挑战。这要求智能体具备广泛的能力,包括泛化与长期推理。许多先前方法基于模型或层次化方法构建,认为显式的长期规划模块有利于学习层次依赖。然而,这些方法需要过多的环境交互次数或庞大的模型规模,限制了实用性。本工作中,我们证明简单而通用的无模型算法近端策略优化(PPO)在采用近期实现技巧优化时优于先前方法。此外,我们发现 PPO 智能体能在某种程度上预测下一待解锁成就,尽管置信度有限。基于该观察,我们引入一种称为成就蒸馏的新型对比学习方法,增强智能体预测下一成就的能力。我们的方法展现出发现层次化成就的强能力,并在具挑战性的 Crafter 环境中以样本高效的方式、使用更少模型参数取得最先进性能。

关键词

引用

@article{arxiv.2307.03486,
  title  = {Discovering Hierarchical Achievements in Reinforcement Learning via Contrastive Learning},
  author = {Seungyong Moon and Junyoung Yeom and Bumsoo Park and Hyun Oh Song},
  journal= {arXiv preprint arXiv:2307.03486},
  year   = {2023}
}

备注

Accepted at NeurIPS 2023