基于时序注意力的对比模块用于多任务强化学习
机器学习
2023-11-03 v1
摘要
在多任务强化学习领域,模块化原则——即将功能专门化到不同模块并适当组合——作为一种有前景的方法被广泛采用,以防止因任务间冲突导致的性能下降这一负迁移问题。然而,现有大多数多任务RL方法仅在任务层面组合共享模块,忽略了任务内部可能存在冲突。此外,这些方法未考虑到在无约束情况下,某些模块可能学习到相似功能,从而限制了模型的表达能力与模块化方法的泛化能力。本文提出基于时序注意力的对比模块(CMTA)方法以解决这些局限。CMTA通过对比学习约束各模块彼此不同,并以比任务层面更细的粒度结合时序注意力来组合共享模块,缓解了任务内的负迁移,提升了多任务RL的泛化能力与性能。我们在Meta-World(一个包含多种机器人操作任务的多任务RL基准)上进行了实验。实验结果表明,CMTA首次超越单独学习各任务的性能,并相较基线取得显著提升。
引用
@article{arxiv.2311.01075,
title = {Contrastive Modules with Temporal Attention for Multi-Task Reinforcement Learning},
author = {Siming Lan and Rui Zhang and Qi Yi and Jiaming Guo and Shaohui Peng and Yunkai Gao and Fan Wu and Ruizhi Chen and Zidong Du and Xing Hu and Xishan Zhang and Ling Li and Yunji Chen},
journal= {arXiv preprint arXiv:2311.01075},
year = {2023}
}
备注
This paper has been accepted at NeurIPS 2023 as a poster