基于跨任务策略引导的高效多任务强化学习
机器学习
2025-07-10 v1 人工智能
摘要
多任务强化学习旨在利用跨各种任务之间的共享信息,促进多个任务的同时学习。现有的主要方法专注于参数共享,采用精心设计的网络结构或量身定制的优化程序。然而,这些方法忽略了一种直接而互补的利用跨任务相似性的方式:已经在某些技能方面较为熟练的任务的控制策略可以为尚未掌握的任务提供明确的引导,以加速技能的获取。为此,我们提出了一种名为 Cross-Task Policy Guidance (CTPG) 的新框架,该框架为每个任务训练一个指导策略,用于从所有任务的控制策略中选择行为策略与环境交互,从而生成更好的训练轨迹。此外,我们提出了两种门控机制来提高 CTPG 的学习效率:一种门控机制过滤掉对引导无益的控制策略,而另一种门控机制阻止不需要引导的任务。CTPG 是一个通用的框架,可适用于现有的参数组共享方法。经验评估表明,将 CTPG 与这些方法集成在操控和运动基准测试中显著提高了性能。
引用
@article{arxiv.2507.06615,
title = {Efficient Multi-Task Reinforcement Learning with Cross-Task Policy Guidance},
author = {Jinmin He and Kai Li and Yifan Zang and Haobo Fu and Qiang Fu and Junliang Xing and Jian Cheng},
journal= {arXiv preprint arXiv:2507.06615},
year = {2025}
}
备注
NeurIPS2024