中文

在线学徒学习

机器学习 2021-12-30 v2 机器学习

摘要

在学徒学习(AL)中,给定一个马尔可夫决策过程(MDP)但无法访问代价函数。相反,我们观测到专家依据某策略采样得到的轨迹。目标是找到在预定义代价函数集上与专家表现相匹配的策略。我们引入 AL 的在线变体(在线学徒学习;OAL),其中智能体在与环境交互时需表现出与专家相当的性能。我们表明 OAL 问题可通过结合两种基于镜像下降的无遗憾算法有效求解:一种用于策略优化,另一种用于学习最坏情况代价。通过采用乐观探索,我们推导出一种收敛算法,其遗憾为 O(K)O(\sqrt{K}),其中 KK 为与 MDP 的交互次数,并带有一个依赖于可用专家轨迹数量的附加线性误差项。重要的是,我们的算法避免了在每次迭代中求解 MDP,因而比先前的 AL 方法更实用。最后,我们实现了我们算法的一种深度变体,其与 GAIL \cite{ho2016generative} 有某些相似之处,但其中的判别器被 OAL 问题学习到的代价所替代。我们的仿真表明 OAL 在高维控制问题中表现良好。

关键词

引用

@article{arxiv.2102.06924,
  title  = {Online Apprenticeship Learning},
  author = {Lior Shani and Tom Zahavy and Shie Mannor},
  journal= {arXiv preprint arXiv:2102.06924},
  year   = {2021}
}

备注

AAAI 2022