模仿学习与结构化预测到无悔在线学习的归约
机器学习
2015-03-17 v3 人工智能
机器学习
摘要
诸如模仿学习等序贯预测问题,其未来观测值依赖于先前的预测(动作),这违背了统计学习中常见的独立同分布(i.i.d.)假设。这导致其在理论上乃至实践中经常表现不佳。近期的一些方法在该设定下提供了更强的保证,但仍有些令人不满意,因为它们训练的策略要么是非平稳的,要么是随机的,并且需要大量迭代。在本文中,我们提出了一种新的迭代算法,该算法训练一个平稳确定性策略,可以看作是在线学习设定中的一种无悔算法。我们证明,任何此类无悔算法,结合额外的归约假设,在此类序贯设定下,必然能找到一个在其诱导的观测分布下表现良好的策略。我们在两个具有挑战性的模仿学习问题和一个基准序列标注问题上证明,这种新方法优于以往的方法。
引用
@article{arxiv.1011.0686,
title = {A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning},
author = {Stephane Ross and Geoffrey J. Gordon and J. Andrew Bagnell},
journal= {arXiv preprint arXiv:1011.0686},
year = {2015}
}
备注
Appearing in the 14th International Conference on Artificial Intelligence and Statistics (AISTATS 2011)