面向在线模仿学习的改进策略优化
机器学习
2022-08-02 v1
摘要
我们考虑在线模仿学习(OIL),其任务是通过与环境的主动交互来寻找模仿专家行为的策略。我们旨在通过分析最流行的 OIL 算法之一 DAGGER,弥合 OIL 策略优化算法的理论与实践之间的差距。具体而言,若策略类足够具有表达能力以包含专家策略,我们证明 DAGGER 可实现常数后悔界。与先前要求损失强凸的界不同,我们的结果仅要求更弱的假设:损失关于策略的充分统计量(而非其参数化)强凸。为确保对更广类别的策略与损失收敛,我们为 DAGGER 增添了额外的正则化项。特别地,我们提出一种用于 OIL 的 Follow-the-Regularized-Leader(FTRL)变体及其自适应变体,并开发了内存高效的实现,其内存需求与 FTL 相匹配。假设损失函数关于策略参数光滑且凸,我们还证明 FTRL 对任意足够具有表达能力的策略类可实现常数后悔界,同时在最坏情况下保持 后悔界。我们通过合成与高维控制任务的实验展示了这些算法的有效性。
引用
@article{arxiv.2208.00088,
title = {Improved Policy Optimization for Online Imitation Learning},
author = {Jonathan Wilder Lavington and Sharan Vaswani and Mark Schmidt},
journal= {arXiv preprint arXiv:2208.00088},
year = {2022}
}
备注
To be published in Conference on Lifelong Learning Agents - CoLLAs 2022