面向离线多任务强化学习的目标导向技能抽象
机器学习
2025-07-10 v1 人工智能
摘要
离线多任务强化学习旨在使用仅包含任务混合数据集的统一策略,解决多个任务,无需与环境进行任何在线交互。然而,它面临在有效跨任务共享知识方面存在显著挑战。受人类高效知识抽象的启发,我们提出了目标导向技能抽象(GO-Skill),一种新方法旨在提取和利用可重用技能,以增强知识传递和任务性能。我们的方法通过目标导向技能提取过程发现可重用技能,并利用向量量化构建离散技能库。为缓解广泛适用技能与任务特定技能之间的类别不平衡,我们引入技能增强阶段来细化提取的技能。此外,我们通过层次策略学习整合这些技能,构建能够动态编排离散技能以完成特定任务的高层策略。广泛的在 MetaWorld 基准中的机器人操控任务实验表明,GO-Skill 的有效性和多样性。
引用
@article{arxiv.2507.06628,
title = {Goal-Oriented Skill Abstraction for Offline Multi-Task Reinforcement Learning},
author = {Jinmin He and Kai Li and Yifan Zang and Haobo Fu and Qiang Fu and Junliang Xing and Jian Cheng},
journal= {arXiv preprint arXiv:2507.06628},
year = {2025}
}
备注
ICML2025