行为克隆就够了吗?理解模仿学习中的视界
机器学习
2024-12-03 v2 人工智能
统计理论
机器学习
统计理论
摘要
模仿学习(IL)旨在通过从示范中学习,在序列决策任务中模仿专家的行为,并已广泛应用于机器人、自动驾驶和自回归文本生成。最简单的IL方法——行为克隆(BC),被认为会产生样本复杂度,该复杂度与问题视界呈不利的二次依赖关系,这促使了各种不同的在线算法,这些算法在对数据和学习者访问专家的更强假设下,实现了改进的线性视界依赖。我们从学习理论的角度重新审视了离线和在线IL之间的明显差距,重点关注可实现/良好指定的设置,其中包含通用策略类,直至深度神经网络。通过对使用对数损失的行为克隆进行新的分析,我们表明,在离线IL中,只要(i)累积收益的范围受到控制,并且(ii)策略类的监督学习复杂度的适当概念受到控制,就可以实现与视界无关的样本复杂度。将我们的结果特化到确定性、平稳策略,我们表明离线和在线IL之间的差距比之前认为的要小:(i)在密集奖励下,可以在离线IL中实现对视界的线性依赖(匹配之前已知仅能在在线IL中实现的结果);(ii)在没有对策略类进一步假设的情况下,即使是在良性的MDP中,在线IL也无法超越使用对数损失的离线IL。我们通过标准RL任务和自回归语言生成的实验来补充我们的理论结果,以验证我们发现的实践相关性。
引用
@article{arxiv.2407.15007,
title = {Is Behavior Cloning All You Need? Understanding Horizon in Imitation Learning},
author = {Dylan J. Foster and Adam Block and Dipendra Misra},
journal= {arXiv preprint arXiv:2407.15007},
year = {2024}
}
备注
NeurIPS 2024