中文

基于随机网络蒸馏的高效主动模仿学习

机器学习 2025-04-15 v2

摘要

为复杂且定义不明确的任务(其中不存在明确的目标)开发智能体仍然具有挑战性,但也带来了许多机会。这在视频游戏中尤为明显,模拟玩家(机器人)需要真实地游玩,且没有明确的奖励来评估它们。虽然模仿学习在此类领域已展现出前景,但这些方法在智能体部署时遇到分布外场景时往往失效。扩展训练数据集是一种常见解决方案,但当依赖人类演示时变得不切实际或成本高昂。本文研究了主动模仿学习,旨在仅在必要时触发专家干预,从而减少训练过程中对持续专家输入的需求。我们提出了随机网络蒸馏DAgger(RND-DAgger),一种新的主动模仿学习方法,通过使用学习到的基于状态的分布外度量来触发干预,从而限制专家查询。该方法避免了频繁的专家-智能体动作比较,因此仅在专家介入有用时才使其介入。我们在3D视频游戏(竞速和第三人称导航)以及机器人运动控制任务中评估了RND-DAgger,结果表明RND-DAgger通过减少专家查询超越了先前方法。

关键词

引用

@article{arxiv.2411.01894,
  title  = {Efficient Active Imitation Learning with Random Network Distillation},
  author = {Emilien Biré and Anthony Kobanda and Ludovic Denoyer and Rémy Portelas},
  journal= {arXiv preprint arXiv:2411.01894},
  year   = {2025}
}

备注

Accepted at ICLR 2025