前驱特征
机器学习
2022-07-26 v3 人工智能
摘要
任何强化学习系统都必须能够识别哪些过去事件对观测结果产生了贡献,这一问题被称为信用分配。该问题的常见解决方案是使用资格迹将信用分配给按近因加权的经验事件集合。然而,在许多现实任务中,最近经历的事件集合仅仅是可能导致当前结果发生的众多可能动作事件之一。这表明,通过允许信用分配给任何可行的前驱状态,而非仅最近经历的状态,可以使强化学习更高效。据此,我们研究了“前驱特征”(Predecessor Features),即 van Hasselt 的“期望迹”(Expected Trace)的完全自举版本,该算法实现了这种更丰富的信用分配形式。通过维护一个近似过去占据期望和的表达,该算法使时序差分(TD)误差能比传统方法更准确地传播到更多前驱状态,极大提升了学习速度。该算法还可自然地从表格状态表示扩展到特征表示,从而在广泛环境中提升性能。我们展示了前驱特征的若干用例,并将其性能与其他方法进行比较。
引用
@article{arxiv.2206.00303,
title = {Predecessor Features},
author = {Duncan Bailey and Marcelo G. Mattar},
journal= {arXiv preprint arXiv:2206.00303},
year = {2022}
}
备注
Accepted to RLDM 2022