中文

稀疏奖励场景下的异构智能体自适应教学:在惊讶平衡中

机器人学 2024-05-24 v1 机器学习

摘要

从演示中学习(LfD)可以通过使 ``学生'' 智能体从最有经验的 ``教师'' 代理的演示中学习,从而高效训练具有类似智能体的系统。然而,当存在代理能力之间的差异时,例如执行器功率差异或关节角度限制,盲目复制超出学生能力范围的演示会限制高效学习。我们提出了专为解决教师与学生代理之间异构性挑战而设计的教师-学生学习框架。该框架基于 ``惊讶'' 的概念,这一概念已在稀疏奖励环境中用于激励探索。我们将惊讶重新定位为使教师检测并适应自身与学生之间的差异的手段。通过专注于最大化其对环境的惊讶,同时最小化学生对演示的惊讶,教师代理能够有效地为学生的特定能力和限制量身定制其演示。我们通过在稀疏奖励环境中的控制任务中展示学生学习的改进来验证了该方法。

关键词

引用

@article{arxiv.2405.14199,
  title  = {Adaptive Teaching in Heterogeneous Agents: Balancing Surprise in Sparse Reward Scenarios},
  author = {Emma Clark and Kanghyun Ryu and Negar Mehr},
  journal= {arXiv preprint arXiv:2405.14199},
  year   = {2024}
}

备注

To be published in L4DC 2024, 10 pages, 5 figures