小样本 regime 下对抗模仿学习的理解:一种阶段耦合分析
机器学习
2026-05-05 v2
摘要
模仿学习从专家轨迹中学习策略。尽管专家数据被认为对模仿质量至关重要,但研究发现一类模仿学习方法——对抗模仿学习(AIL)——可以表现出卓越的性能。仅使用一条专家轨迹,AIL即可在长时域任务(如运动控制)上匹配专家表现。该现象中有两个神秘之处。第一,为何AIL仅用极少专家轨迹便能表现良好?第二,为何AIL不顾规划时域长度仍能保持良好性能?本文从理论层面探究这两个问题。对于基于总变距离的AIL(称为TV-AIL),我们的分析在一类从运动控制任务中抽象出的实例上给出了无时域依赖的模仿差距 。此处 为表格型马尔可夫决策过程的状态空间大小, 为专家轨迹数量。我们强调该界的两个重要特征。第一,该界在小样本与大样本 regime 下均有意义。第二,该界表明TV-AIL的模仿差距至多仅为1,与规划时域无关。因此,该界可解释上述经验观测。在技术上,我们利用TV-AIL中多阶段策略优化的结构,通过动态规划给出了一种新的阶段耦合分析。
引用
@article{arxiv.2208.01899,
title = {Understanding Adversarial Imitation Learning in Small Sample Regime: A Stage-coupled Analysis},
author = {Tian Xu and Ziniu Li and Yang Yu and Zhi-Quan Luo},
journal= {arXiv preprint arXiv:2208.01899},
year = {2026}
}