利用广义相似函数改进离线强化学习中的零样本泛化
机器学习
2021-11-30 v1 人工智能
摘要
强化学习(RL)智能体被广泛用于解决复杂的序贯决策任务,但在泛化到训练期间未见的场景时仍存在困难。虽然先前的在线方法表明,使用奖励函数之外的额外信号可提升RL智能体的泛化能力(即使用自监督学习(SSL)),但它们在离线RL设定(即从静态数据集中学习)中表现不佳。我们表明,由于观测间相似度估计不佳,RL中用于泛化的在线算法性能在离线设定下会受阻碍。我们提出一个理论驱动的新框架,称为广义相似函数(GSF),其使用对比学习训练离线RL智能体,根据期望未来行为的相似性聚合观测,其中我们使用广义值函数量化该相似性。我们表明GSF具有足够的一般性以恢复现有SSL目标,同时还提升了在复杂离线RL基准offline Procgen上的零样本泛化性能。
引用
@article{arxiv.2111.14629,
title = {Improving Zero-shot Generalization in Offline Reinforcement Learning using Generalized Similarity Functions},
author = {Bogdan Mazoure and Ilya Kostrikov and Ofir Nachum and Jonathan Tompson},
journal= {arXiv preprint arXiv:2111.14629},
year = {2021}
}
备注
Offline RL workshop at NeurIPS 2021