面向强化学习的大规模检索
机器学习
2022-12-20 v2 人工智能
摘要
有效的决策涉及将过往经验与相关上下文信息灵活关联到新颖情境。在深度强化学习(RL)中,主导范式是智能体通过对训练损失进行梯度下降,将有助于决策的信息摊销至其网络权重中。在此,我们追求一种替代方法:智能体可利用大规模上下文敏感数据库查找来支撑其参数化计算。这使得智能体能够以端到端方式直接学习利用相关信息以指导其输出。此外,新信息可被智能体关注到而无需重新训练,只需扩充检索数据集即可。我们在 9x9 围棋的离线 RL 中研究该方法,这是一款极具挑战性的游戏,其庞大的组合状态空间使得泛化比直接匹配过往经验更为重要。我们利用快速近似最近邻技术,从数千万专家示范状态集中检索相关数据。关注此信息相较仅将这些示范用作训练轨迹,在预测准确率与对弈性能上带来显著提升,有力证明了大规模检索在离线 RL 智能体中的价值。
引用
@article{arxiv.2206.05314,
title = {Large-Scale Retrieval for Reinforcement Learning},
author = {Peter C. Humphreys and Arthur Guez and Olivier Tieleman and Laurent Sifre and Théophane Weber and Timothy Lillicrap},
journal= {arXiv preprint arXiv:2206.05314},
year = {2022}
}
备注
Thirty-sixth Annual Conference on Neural Information Processing Systems (NeurIPS 2022), 16 pages