强化学习中干扰的度量与缓解
机器学习
2023-07-12 v1 人工智能
摘要
灾难性干扰在许多基于网络的学习系统中十分常见,并且已有许多缓解它的提议。在克服干扰之前,我们必须更好地理解它。在本工作中,我们为基于价值的强化学习方法(如Fitted Q-Iteration和DQN)提供了干扰的定义与一种新颖的度量。我们系统地评估了我们的干扰度量,表明其在多种网络架构下与控制性能的不稳定性相关。我们新的干扰度量使我们能够针对常用深度学习架构提出新的科学问题,并研究缓解干扰的学习算法。最后,我们概述了一类称为online-aware的算法,其设计用于缓解干扰,并表明它们依据我们的度量确实减少了干扰,且在多个经典控制环境中改善了稳定性与性能。
引用
@article{arxiv.2307.04887,
title = {Measuring and Mitigating Interference in Reinforcement Learning},
author = {Vincent Liu and Han Wang and Ruo Yu Tao and Khurram Javed and Adam White and Martha White},
journal= {arXiv preprint arXiv:2307.04887},
year = {2023}
}
备注
Published at Conference on Lifelong Learning Agents (CoLLAs) 2023