理解多任务策略优化中的默认策略
机器学习
2022-03-24 v4
摘要
深度强化学习近期的大部分成功是由正则化策略优化(RPO)算法驱动的,该算法在多个领域均具有出色的性能。在这类方法中,智能体被训练以最大化累积奖励,同时惩罚其行为相对于某个参考或默认策略的偏差。除了经验上的成功,理解应用于单任务的 RPO 方法还有着坚实的理论基础,并与自然梯度、信赖域和变分方法相关联。然而,对于多任务设置中默认策略的期望性质,目前仍缺乏形式化的理解;随着该领域转向训练更具通用能力的智能体,这一领域变得越来越重要。在本文中,我们朝着填补这一空白迈出了第一步,将默认策略的质量与其对优化的影响进行了形式化关联。利用这些结果,我们随后推导出了一种用于多任务学习的、具有强性能保证的原则性 RPO 算法。
引用
@article{arxiv.2111.02994,
title = {Towards an Understanding of Default Policies in Multitask Policy Optimization},
author = {Ted Moskovitz and Michael Arbel and Jack Parker-Holder and Aldo Pacchiano},
journal= {arXiv preprint arXiv:2111.02994},
year = {2022}
}