离线发现具有可解释技能的多任务轨迹
机器人学
2026-02-03 v1 人工智能
摘要
层次化模仿学习是获取机器人复杂行为的强大范式,但核心挑战在于从长时序、多任务的离线数据中发现可复用的技能,尤其当数据缺乏明确的奖励或子任务标注时。本文引入 LOKI,一个用于离线技能发现和层次化模仿的三阶段端到端学习框架。该框架以两个阶段的弱监督技能发现过程开始:第一阶段通过受弱任务标签约束的对齐驱动的向量量化变分自编码器(VAE),执行粗糙的、任务感知的宏观分段;第二阶段则使用自监督序列模型对这些分段进行微观细化,并通过迭代聚类过程Consolidate技能边界。第三阶段则利用这些精确的边界在基于选项(option)的框架内构建层次化策略,包括学习到的终止条件beta用于显式技能切换。LOKI 在具有挑战性的 D4RL Kitchen 基准测试中实现高成功率,优于标准层次化模仿基线方法。 Furthermore, 我们展示了所发现的技能在语义上具有意义,符合人类直觉,并通过成功地对其进行排序以解决 novel、未见的任务表现出可组合性。
关键词
引用
@article{arxiv.2602.01018,
title = {Offline Discovery of Interpretable Skills from Multi-Task Trajectories},
author = {Chongyu Zhu and Mithun Vanniasinghe and Jiayu Chen and Chi-Guhn Lee},
journal= {arXiv preprint arXiv:2602.01018},
year = {2026}
}