同状态异任务:无干扰的持续强化学习
机器学习
2022-03-16 v2 人工智能
摘要
持续学习(CL)考虑按顺序在一组任务上训练智能体,同时力求保留在所有先前任务上的性能。CL 中的一个关键挑战是灾难性遗忘,即在掌握某任务后学习新任务时该任务性能下降。尽管存在多种对抗遗忘的方法,但在某些情况下任务之间根本互不相容,因此无法由单一策略学会。在强化学习(RL)中,当智能体可能因相同观测而因达成不同目标受奖励时,便会出现这种情况。本文中将此“干扰”形式化,以区别于遗忘问题。我们表明,基于共享回放缓冲的单神经网络预测器的现有 CL 方法在存在干扰时失效。相反,我们提出一种简单方法 OWL 应对该挑战。OWL 学习因子化策略,使用共享特征提取层,但为各新任务设独立头。OWL 中的独立头用于防止干扰。在测试时,我们将策略选择表述为多臂_bandit 问题,并表明可利用环境反馈为未知任务选择最佳策略。bandit 算法的使用使 OWL 智能体能在同一回合的不同时刻建设性复用不同的持续学习策略。我们在多个 RL 环境中展示,现有的基于回放的 CL 方法失效,而 OWL 在顺序训练时能取得接近最优的性能。
引用
@article{arxiv.2106.02940,
title = {Same State, Different Task: Continual Reinforcement Learning without Interference},
author = {Samuel Kessler and Jack Parker-Holder and Philip Ball and Stefan Zohren and Stephen J. Roberts},
journal= {arXiv preprint arXiv:2106.02940},
year = {2022}
}
备注
Accepted as an oral at AAAI 2022. 17 pages and 12 figures