数据高效的多任务 DAgger
机器学习
2025-10-01 v1 人工智能
摘要
能够执行多种任务的通用机器人策略通常需要大量专家数据或仿真来进行训练。在本工作中,我们提出了一种新颖的数据高效的多任务 DAgger 框架,该框架从多个特定任务的专家策略中蒸馏出单一的多任务策略。我们的方法通过主动聚焦于多任务策略表现不佳的任务,显著提高了整体任务成功率。我们方法的核心是一种性能感知调度策略,该策略使用基于卡尔曼滤波的估计器来跟踪每个任务的学习过程从数据量中获益的程度,从而稳健地决定如何在各任务间分配额外的示范。我们在 MetaWorld 以及 IsaacLab 中的一组多样化抽屉开启任务上验证了我们的方法。所得策略在所有任务上均取得了高性能,同时使用的专家示范大幅减少;并且在不使用真实数据的情况下,在仿真中用我们方法学习到的视觉策略在零样本迁移至真实机器人时,表现出优于朴素 DAgger 和行为克隆的性能。
引用
@article{arxiv.2509.25466,
title = {Data-Efficient Multitask DAgger},
author = {Haotian Fu and Ran Gong and Xiaohan Zhang and Maria Vittoria Minniti and Jigarkumar Patel and Karl Schmeckpeper},
journal= {arXiv preprint arXiv:2509.25466},
year = {2025}
}