中文

多样化多任务数据上的离线Q学习兼具规模扩展与泛化能力

机器学习 2023-04-19 v2

摘要

离线强化学习(RL)的潜力在于,在大型异构数据集上训练的高容量模型可以产生广泛泛化的智能体,类似于视觉和自然语言处理(NLP)领域的类似进展。然而,近期工作认为离线RL方法在扩大模型容量时面临独特挑战。借鉴这些工作的经验,我们重新审视了以往的设计选择,并发现通过适当选择:ResNet、基于交叉熵的分布备份以及特征归一化,离线Q学习算法展现出随模型容量扩展的强劲性能。使用多任务Atari作为扩展和泛化的测试平台,我们训练了一个在40款游戏上达到接近人类性能的单一策略,使用了多达8000万参数的神经网络,发现模型性能随容量增加而有利地扩展。与先前工作相比,即使完全在一个庞大(4亿次转移)但高度次优的数据集(51%人类水平性能)上训练,我们也能外推超越数据集性能。与基于回报条件的监督方法相比,离线Q学习在模型容量扩展方面表现相似,且性能更优,尤其是在数据集次优时。最后,我们表明,使用多样化数据集的离线Q学习足以学习强大的表征,这些表征有助于快速迁移到新游戏,并在训练游戏的变体上进行快速在线学习,超越了现有的最先进表征学习方法。

关键词

引用

@article{arxiv.2211.15144,
  title  = {Offline Q-Learning on Diverse Multi-Task Data Both Scales And Generalizes},
  author = {Aviral Kumar and Rishabh Agarwal and Xinyang Geng and George Tucker and Sergey Levine},
  journal= {arXiv preprint arXiv:2211.15144},
  year   = {2023}
}

备注

Accepted at ICLR 2023. Project website: https://sites.google.com/view/scaling-offlinerl/home