中文

通过元学习构建动作排序器的次优演示学习

机器学习 2024-12-31 v1 人工智能

摘要

imitation learning 的主要瓶颈是需要大量专家演示,而这既昂贵又难以获取。学习来自非严格质量要求的补充演示的做法已成为解决这一挑战的强大范式。然而,前述方法往往通过丢弃非专家数据而未能充分发挥其潜力。我们的关键洞察是,即使演示超出专家分布范围但优于所学习策略,仍可提升策略性能。为充分利用这一潜力,我们提出了一种新方法,称为 imitation learning via meta-learning an action ranker (ILMAR)。ILMAR 在有限的专家演示集中引入补充演示,并对其进行加权行为克隆(weighted BC)。它利用优势函数的函数形式,选择性地整合来自补充演示的知识。为更有效地利用补充演示,ILMAR 引入 meta-goal,通过显式最小化当前策略与专家策略之间的距离来优化优势函数的函数形式。通过大量任务的全面实验表明,ILMAR 在处理次优演示方面显著优于先前方法。代码已公开于 https://github.com/F-GOD6/ILMAR。

关键词

引用

@article{arxiv.2412.20193,
  title  = {Imitation Learning from Suboptimal Demonstrations via Meta-Learning An Action Ranker},
  author = {Jiangdong Fan and Hongcai He and Paul Weng and Hui Xu and Jie Shao},
  journal= {arXiv preprint arXiv:2412.20193},
  year   = {2024}
}