从过去到未来:重新思考资格迹
机器学习
2023-12-21 v1
摘要
在本文中,我们引入了一个关于信用分配与策略评估挑战的新视角。首先,我们深入探讨了资格迹的细微之处,并探索了其更新可能导致对先前状态产生意外信用分配的情况。从这项研究中诞生了一种新的价值函数概念,我们称之为双向价值函数。与传统的状态价值函数不同,双向价值函数同时考虑了未来预期回报(从当前状态起预期的奖励)和过去预期回报(从回合开始到现在的累积奖励)。我们推导了学习该价值函数的原则性更新方程,并通过实验证明了其在增强策略评估过程中的有效性。具体而言,我们的结果表明,在某些具有挑战性的情境中,所提出的学习方法可以比 TD() ——一种直接学习前向价值函数 的方法——更快速地进行策略评估。总体而言,我们的发现为资格迹及其启发的新型价值函数提供了新的视角,并揭示了与之相关的潜在优势,尤其是在策略评估方面。
引用
@article{arxiv.2312.12972,
title = {From Past to Future: Rethinking Eligibility Traces},
author = {Dhawal Gupta and Scott M. Jordan and Shreyas Chaudhari and Bo Liu and Philip S. Thomas and Bruno Castro da Silva},
journal= {arXiv preprint arXiv:2312.12972},
year = {2023}
}
备注
Accepted in The 38th Annual AAAI Conference on Artificial Intelligence