本可、应能、该当:反事实引导的策略搜索
机器学习
2018-11-16 v1 机器学习
摘要
在模型合成的数据上学习策略,原则上可以缓解强化学习算法对大量真实经验的渴求,而真实经验往往获取代价高昂。然而,对许多复杂环境而言,从头合成合理的经验是一个难题,常导致基于模型的策略评估与搜索产生偏差。本文不采用从头合成数据的方式,而是假设已有记录的真实经验,并在反事实动作(即实际未采取的动作)下对这段经验的替代结果进行建模。基于此,我们提出反事实引导的策略搜索(Counterfactually-Guided Policy Search, CF-GPS)算法,用于从离屏经验中在部分可观测马尔可夫决策过程(POMDPs)中学习策略。该算法利用结构因果模型对单个离屏片段上的任意策略进行反事实评估。CF-GPS 可通过利用可用的记录数据去偏模型预测,从而改进朴素的基于模型的强化学习算法。与基于重要性采样(Importance Sampling)对数据重新加权的离屏算法不同,CF-GPS 利用模型显式考虑替代结果,使算法能更好地利用经验数据。我们在实证中发现,这些优势在一个非平凡的网格世界任务上转化为改进的策略评估与搜索结果。最后,我们表明 CF-GPS 推广了先前提出的引导式策略搜索(Guided Policy Search),并且基于重参数化的算法(如随机价值梯度 Stochastic Value Gradient)可被解释为反事实方法。
引用
@article{arxiv.1811.06272,
title = {Woulda, Coulda, Shoulda: Counterfactually-Guided Policy Search},
author = {Lars Buesing and Theophane Weber and Yori Zwols and Sebastien Racaniere and Arthur Guez and Jean-Baptiste Lespiau and Nicolas Heess},
journal= {arXiv preprint arXiv:1811.06272},
year = {2018}
}