中文

基于辅助任务蒸馏的强化学习

机器学习 2024-06-26 v1 人工智能 机器人学

摘要

我们提出了一种基于辅助任务蒸馏的强化学习方法(AuxDistill),通过从辅助RL任务中蒸馏行为,使强化学习能够解决长期程机器人控制问题。AuxDistill通过同时进行多任务RL(辅助任务易于学习且与主任务相关)来实现这一点。加权蒸馏损失将来自这些辅助任务的行为传递以解决主任务。我们展示了AuxDistill能够从环境奖励中学习针对挑战性的多阶段具象化物体重新排列任务的像素到动作策略,而无需演示、学习课程或预训练技能。AuxDistill在Habitat物体重新排列基准中实现的成功率是前一方法的最新基准的2.3×2.3 \times,并优于使用预训练技能和专家演示的方法。

关键词

引用

@article{arxiv.2406.17168,
  title  = {Reinforcement Learning via Auxiliary Task Distillation},
  author = {Abhinav Narayan Harish and Larry Heck and Josiah P. Hanna and Zsolt Kira and Andrew Szot},
  journal= {arXiv preprint arXiv:2406.17168},
  year   = {2024}
}