中文

利用广义相似函数改进离线强化学习中的零样本泛化

机器学习 2021-11-30 v1 人工智能

摘要

强化学习(RL)智能体被广泛用于解决复杂的序贯决策任务,但在泛化到训练期间未见的场景时仍存在困难。虽然先前的在线方法表明,使用奖励函数之外的额外信号可提升RL智能体的泛化能力(即使用自监督学习(SSL)),但它们在离线RL设定(即从静态数据集中学习)中表现不佳。我们表明,由于观测间相似度估计不佳,RL中用于泛化的在线算法性能在离线设定下会受阻碍。我们提出一个理论驱动的新框架,称为广义相似函数(GSF),其使用对比学习训练离线RL智能体,根据期望未来行为的相似性聚合观测,其中我们使用广义值函数量化该相似性。我们表明GSF具有足够的一般性以恢复现有SSL目标,同时还提升了在复杂离线RL基准offline Procgen上的零样本泛化性能。

关键词

引用

@article{arxiv.2111.14629,
  title  = {Improving Zero-shot Generalization in Offline Reinforcement Learning using Generalized Similarity Functions},
  author = {Bogdan Mazoure and Ilya Kostrikov and Ofir Nachum and Jonathan Tompson},
  journal= {arXiv preprint arXiv:2111.14629},
  year   = {2021}
}

备注

Offline RL workshop at NeurIPS 2021