中文

未知转移下可证明高效的对抗模仿学习

机器学习 2023-06-14 v1

摘要

模仿学习(IL)已被证明是从专家示范中学习优良策略的有效方法。对抗模仿学习(AIL)作为IL方法的一个子集特别有前景,但其在未知转移存在下的理论基础尚待充分建立。本文探讨该背景下AIL的理论基础,其中环境转移的随机与不确定性质带来了挑战。我们考察恢复优良策略所需的专家样本复杂度和交互复杂度。为此,我们建立连接无奖励探索与AIL的框架,并提出一种算法MB-TAIL,实现了O~(H3/2S/ε)\widetilde{O} (H^{3/2} |S|/\varepsilon)的极小极大最优专家样本复杂度和O~(H3S2A/ε2)\widetilde{O} (H^{3} |S|^2 |A|/\varepsilon^2)的交互复杂度。此处,HH表示规划时域,S|S|为状态空间大小,A|A|为动作空间大小,ε\varepsilon为期望模仿差距。MB-TAIL是首个在未知转移设定下达到该专家样本复杂度水平的算法,并将已知最优算法OAL的交互复杂度提升了O(H)O(H)。此外,我们将MB-TAIL推广至函数近似设定,证明其专家样本与交互复杂度可独立于S|S|,从而展示了其泛化能力。

关键词

引用

@article{arxiv.2306.06563,
  title  = {Provably Efficient Adversarial Imitation Learning with Unknown Transitions},
  author = {Tian Xu and Ziniu Li and Yang Yu and Zhi-Quan Luo},
  journal= {arXiv preprint arXiv:2306.06563},
  year   = {2023}
}

备注

arXiv admin note: text overlap with arXiv:2106.10424