表征的时间解耦以提升强化学习泛化能力
机器学习
2023-02-28 v4
摘要
强化学习(RL)智能体通常无法很好地泛化到训练期间未在状态空间中观察到的环境变化。对于基于图像的 RL 而言,该问题尤为严重,因为仅一个变量(如背景颜色)的改变就可能导致图像中许多像素发生变化。变化的像素可能导致智能体对图像潜在表征的剧烈改变,致使学习到的策略失效。为学习更鲁棒的表征,我们引入了时间解耦(TEmporal Disentanglement,TED),这是一种自监督辅助任务,利用 RL 观测的序列特性实现图像表征的解耦。我们通过实证发现,与最先进的表征学习方法相比,将 TED 作为辅助任务的 RL 算法在持续训练下能更快地适应环境变量变化。由于 TED 强制表征具有解耦结构,我们的实验还表明,使用 TED 训练的策略能更好地泛化到与任务无关的变量(如背景颜色)的未见过取值,以及影响最优策略的变量(如目标位置)的未见过取值。
引用
@article{arxiv.2207.05480,
title = {Temporal Disentanglement of Representations for Improved Generalisation in Reinforcement Learning},
author = {Mhairi Dunion and Trevor McInroe and Kevin Sebastian Luck and Josiah P. Hanna and Stefano V. Albrecht},
journal= {arXiv preprint arXiv:2207.05480},
year = {2023}
}
备注
International Conference on Learning Representations (ICLR), 2023