HarmoDT:用于离线强化学习的和谐多任务决策变换器
机器学习
2024-05-29 v1
摘要
离线多任务强化学习(MTRL)的目的是开发适用于多样化任务的统一策略,而无需在线环境交互。最近的进展通过序列建模实现,利用 Transformer 架构的可扩展性和参数共享的优势来挖掘任务之间的相似性。然而,任务内容和复杂度的差异为策略制定提出了重大挑战, necessitating 仔明智的 参数共享和管理冲突梯度以获得最佳策略性能。在本工作中,我们引入了和谐多任务决策变换器(HarmoDT),一种新型解决方案,旨在为每个任务识别最佳和谐子空间的参数。我们将其作为双层优化问题来处理,采用基于梯度的技术构建元学习框架。该框架的上层专注于学习特定于任务的掩码,以划分和谐子空间,而内层则专注于更新参数以提高统一策略的整体性能。在一系列基准测试上的经验评估表明,HarmoDT 的优势尤为显著,验证了我们方法的有效性。
引用
@article{arxiv.2405.18080,
title = {HarmoDT: Harmony Multi-Task Decision Transformer for Offline Reinforcement Learning},
author = {Shengchao Hu and Ziqing Fan and Li Shen and Ya Zhang and Yanfeng Wang and Dacheng Tao},
journal= {arXiv preprint arXiv:2405.18080},
year = {2024}
}
备注
Published at ICML 2024