对比回溯:在强化学习中聚焦关键步骤以实现快速学习与泛化
机器学习
2023-10-31 v7 人工智能
摘要
在现实生活中,成功往往依赖于多个关键步骤,这些步骤在时间上彼此相距较远,且与最终奖励也存在时滞。这些关键步骤难以用依赖Bellman方程进行信用分配的传统强化学习(RL)方法识别。在此,我们提出一种利用离线对比学习聚焦这些关键步骤的新RL算法。该算法称为对比回溯(ConSpec),可添加至任意现有RL算法。ConSpec通过一种新颖的对比损失学习任务中关键步骤的一组原型,并在当前状态与某一原型匹配时给予内在奖励。ConSpec中的原型为信用分配带来两个关键益处:(i)它们能快速识别所有关键步骤;(ii)它们以易于解释的方式实现这一点,从而在感官特征改变时实现分布外泛化。与当代其他信用分配RL方法不同,ConSpec利用这样一个事实:回顾性地识别成功所依赖的少量步骤(并忽略其他状态)比前瞻性地预测每步所采取动作的奖励更为容易。ConSpec在多种RL任务中大幅改善学习。代码见链接:https://github.com/sunchipsster1/ConSpec
引用
@article{arxiv.2210.05845,
title = {Contrastive Retrospection: honing in on critical steps for rapid learning and generalization in RL},
author = {Chen Sun and Wannan Yang and Thomas Jiralerspong and Dane Malenfant and Benjamin Alsbury-Nealy and Yoshua Bengio and Blake Richards},
journal= {arXiv preprint arXiv:2210.05845},
year = {2023}
}