基于后继特征的 SF-DQN: 面向深度强化学习的可证知识迁移
机器学习
2024-09-24 v2 机器学习
摘要
本文研究的是多任务强化学习(RL)问题,其中多个 RL 问题具有不同的奖励函数但共享相同的 underlying 转换动力学。在此设置下,每个 RL 问题(任务)的 Q 函数可分解为后继特征(SF)和奖励映射:前者刻画转换动力学,后者刻画任务特定的奖励函数。这种 Q 函数分解结合称为广义政策改进(GPI)的政策改进算子,可减少寻找最优 Q 函数的样本复杂度,因此 SF 与 GPI 框架在深度 Q 学习等传统 RL 方法中表现出具有前景的实证性能。然而,其理论基础仍基本未建立,尤其是当使用深度神经网络学习后继特征(SF-DQN)时。本文研究了在 transfer RL 问题中使用 SFs-DQN 实现可证知识迁移。我们建立了 SF-DQN 配合 GPI 具有可证明泛化保证的首个收敛分析。理论揭示了 SF-DQN 配合 GPI 在收敛速度和泛化方面优于传统 RL 方法,如深度 Q 网络。数值实验在真实和合成 RL 任务上支持了 SF-DQN 与 GPI 的优越性能,与我们的理论发现一致。
引用
@article{arxiv.2405.15920,
title = {SF-DQN: Provable Knowledge Transfer using Successor Feature for Deep Reinforcement Learning},
author = {Shuai Zhang and Heshan Devaka Fernando and Miao Liu and Keerthiram Murugesan and Songtao Lu and Pin-Yu Chen and Tianyi Chen and Meng Wang},
journal= {arXiv preprint arXiv:2405.15920},
year = {2024}
}
备注
arXiv admin note: text overlap with arXiv:2310.16173