多任务分层对抗逆强化学习
机器学习
2023-06-29 v2
摘要
多任务模仿学习(MIL)旨在基于多任务专家示范训练出能够执行任务分布的策略,这对于通用机器人至关重要。现有 MIL 算法数据效率低,且在复杂长程任务上表现不佳。我们提出多任务分层对抗逆强化学习(MH-AIRL)以学习分层结构的多任务策略,其更利于具有长程的组合式任务,并通过识别与跨任务迁移可复用的基础技能而具有更高的专家数据效率。为此,MH-AIRL 有效融合了基于上下文的多任务学习、AIRL(一种 IL 方法)与分层策略学习。此外,MH-AIRL 可应用于无任务或技能标注(即仅有状态-动作对)的示范,这类数据在实践中更易获取。本文为 MH-AIRL 的各模块提供了理论依据,并在具有挑战性的多任务设定上的评估表明,与 SOTA MIL 基线相比,用 MH-AIRL 学到的多任务策略具有更优的性能与可迁移性。
引用
@article{arxiv.2305.12633,
title = {Multi-task Hierarchical Adversarial Inverse Reinforcement Learning},
author = {Jiayu Chen and Dipesh Tamboli and Tian Lan and Vaneet Aggarwal},
journal= {arXiv preprint arXiv:2305.12633},
year = {2023}
}
备注
This paper is accepted at ICML 2023. arXiv admin note: text overlap with arXiv:2210.01969