中文

PolyTask:通过行为蒸馏学习统一策略

机器人学 2023-10-13 v1

摘要

能够解决广泛任务统一模型因可在任务间共享规律与结构,从而提升单任务表现并降低计算开销,在视觉与NLP领域已获关注。然而,此类模型在具身学习问题中的影响仍然有限,后者因交互性、样本低效与顺序任务呈现而带来独特挑战。本工作中,我们提出PolyTask,一种通过'先学习后蒸馏'机制学习可解决各类具身任务的单一统一模型的新方法。在'学习'步中,PolyTask利用每任务少量演示训练特定任务策略。随后在'蒸馏'步中,使用称为行为蒸馏的新蒸馏方法将特定任务策略蒸馏为单一策略。给定统一策略,可通过条件变量提取个别任务行为。PolyTask设计上概念简洁,同时能利用RL中成熟算法实现交互性、少量专家演示以实现样本高效,并在蒸馏时禁止对任务的交互访问以实现终身学习。在三个仿真环境套件与一个真实机器人套件上的实验表明,PolyTask在多任务与终身学习设定下以显著优势超越先前最优方法。

关键词

引用

@article{arxiv.2310.08573,
  title  = {PolyTask: Learning Unified Policies through Behavior Distillation},
  author = {Siddhant Haldar and Lerrel Pinto},
  journal= {arXiv preprint arXiv:2310.08573},
  year   = {2023}
}