未知转移下可证明高效的对抗模仿学习
机器学习
2023-06-14 v1
摘要
模仿学习(IL)已被证明是从专家示范中学习优良策略的有效方法。对抗模仿学习(AIL)作为IL方法的一个子集特别有前景,但其在未知转移存在下的理论基础尚待充分建立。本文探讨该背景下AIL的理论基础,其中环境转移的随机与不确定性质带来了挑战。我们考察恢复优良策略所需的专家样本复杂度和交互复杂度。为此,我们建立连接无奖励探索与AIL的框架,并提出一种算法MB-TAIL,实现了的极小极大最优专家样本复杂度和的交互复杂度。此处,表示规划时域,为状态空间大小,为动作空间大小,为期望模仿差距。MB-TAIL是首个在未知转移设定下达到该专家样本复杂度水平的算法,并将已知最优算法OAL的交互复杂度提升了。此外,我们将MB-TAIL推广至函数近似设定,证明其专家样本与交互复杂度可独立于,从而展示了其泛化能力。
引用
@article{arxiv.2306.06563,
title = {Provably Efficient Adversarial Imitation Learning with Unknown Transitions},
author = {Tian Xu and Ziniu Li and Yang Yu and Zhi-Quan Luo},
journal= {arXiv preprint arXiv:2306.06563},
year = {2023}
}
备注
arXiv admin note: text overlap with arXiv:2106.10424