我本应获得该奖励吗?基于反事实贡献分析的长程信用分配
机器学习
2023-11-01 v2 机器学习
摘要
为使强化学习更具样本效率,我们需要更好的信用分配方法,以衡量动作对未来奖励的影响。在事后信用分配(HCA)的基础上,我们提出反事实贡献分析(COCOA),一类基于模型的新型信用分配算法。我们的算法通过衡量动作在获得后续奖励时的贡献来实现精确信用分配,具体通过量化一个反事实查询:“若智能体采取了另一动作,它是否仍会获得该奖励?”。我们表明,如HCA那样针对奖励状态衡量贡献,会导致虚假的贡献估计,使HCA在许多相关环境中退化为高方差的REINFORCE估计器。相反,我们针对奖励或奖励对象的学习表示来衡量贡献,从而得到方差更低的梯度估计。我们在专门设计用于评估长程信用分配能力的一组问题上进行了实验。通过动态规划,我们度量了真实策略梯度,并表明我们新的基于模型的信用分配方法相比HCA和常见基线具有更低的偏差与方差,从而带来性能提升。我们的结果展示了如何建模动作对奖励结果的贡献以用于信用分配,为样本高效的强化学习开辟了新路径。
引用
@article{arxiv.2306.16803,
title = {Would I have gotten that reward? Long-term credit assignment by counterfactual contribution analysis},
author = {Alexander Meulemans and Simon Schug and Seijin Kobayashi and Nathaniel Daw and Gregory Wayne},
journal= {arXiv preprint arXiv:2306.16803},
year = {2023}
}
备注
NeurIPS 2023 spotlight