中文

行为克隆就够了吗?理解模仿学习中的视界

机器学习 2024-12-03 v2 人工智能 统计理论 机器学习 统计理论

摘要

模仿学习(IL)旨在通过从示范中学习,在序列决策任务中模仿专家的行为,并已广泛应用于机器人、自动驾驶和自回归文本生成。最简单的IL方法——行为克隆(BC),被认为会产生样本复杂度,该复杂度与问题视界呈不利的二次依赖关系,这促使了各种不同的在线算法,这些算法在对数据和学习者访问专家的更强假设下,实现了改进的线性视界依赖。我们从学习理论的角度重新审视了离线和在线IL之间的明显差距,重点关注可实现/良好指定的设置,其中包含通用策略类,直至深度神经网络。通过对使用对数损失的行为克隆进行新的分析,我们表明,在离线IL中,只要(i)累积收益的范围受到控制,并且(ii)策略类的监督学习复杂度的适当概念受到控制,就可以实现与视界无关的样本复杂度。将我们的结果特化到确定性、平稳策略,我们表明离线和在线IL之间的差距比之前认为的要小:(i)在密集奖励下,可以在离线IL中实现对视界的线性依赖(匹配之前已知仅能在在线IL中实现的结果);(ii)在没有对策略类进一步假设的情况下,即使是在良性的MDP中,在线IL也无法超越使用对数损失的离线IL。我们通过标准RL任务和自回归语言生成的实验来补充我们的理论结果,以验证我们发现的实践相关性。

关键词

引用

@article{arxiv.2407.15007,
  title  = {Is Behavior Cloning All You Need? Understanding Horizon in Imitation Learning},
  author = {Dylan J. Foster and Adam Block and Dipendra Misra},
  journal= {arXiv preprint arXiv:2407.15007},
  year   = {2024}
}

备注

NeurIPS 2024