基于技能正则化的多任务离线强化学习任务分解
机器学习
2024-08-29 v1
摘要
利用由不同行为策略生成的异构离线数据集的强化学习(RL)能够充分利用多个任务之间的关系以及跨这些任务所学习的共同技能,从而以数据驱动的方式有效地解决实际中的复杂问题。在离线 RL 中仅使用离线数据且受限于与环境的在线交互的情况下,尤其当数据质量在不同任务之间变化时,仍然难以为多个任务获得最优策略。本文提出一种基于技能的多任务 RL 方法,用于处理由不同质量行为策略生成的异构数据集。为了有效学习跨数据集的共享知识,我们采用一种任务分解方法,其中共同技能被联合学习,并用作指导将任务重新表述为可共享且可实现的子任务。在这种联合学习中,我们使用 Wasserstein 自动编码器(WAE)将技能和任务都表示在相同的潜空间中,并使用质量加权损失作为正则化项,以诱导任务分解为更符合高质量技能的子任务。为了提高在潜空间上学习的离线 RL 代理的性能,我们还为每个任务增强了与高质量技能相关的虚构轨迹。通过实验,我们表明该多任务离线 RL 方法对混合配置的不同质量数据集具有鲁棒性,并且在多个机器人操作任务和无人机导航任务上 outperform 了其他最先进的算法。
引用
@article{arxiv.2408.15593,
title = {Skills Regularized Task Decomposition for Multi-task Offline Reinforcement Learning},
author = {Minjong Yoo and Sangwoo Cho and Honguk Woo},
journal= {arXiv preprint arXiv:2408.15593},
year = {2024}
}
备注
12 pages, 5 figures, acceepted in NeurIPS 2022