中文

稳定且高效的策略评估

机器学习 2021-12-30 v2 机器学习

摘要

策略评估算法由于能够预测策略的性能,对强化学习至关重要。然而,这一预测问题存在两个亟待解决的长久问题:离策略稳定性和在策略效率。传统的时序差分(TD)算法在在策略设定下表现非常好,但不具有离策略稳定性。另一方面,梯度 TD 和强调型 TD 算法具有离策略稳定性,但不具有在策略效率。本文利用斜投影方法引入了既具有离策略稳定性又具有在策略效率的新算法。在不同领域上的实证实验结果验证了所提方法的有效性。

关键词

引用

@article{arxiv.2006.03978,
  title  = {Stable and Efficient Policy Evaluation},
  author = {Daoming Lyu and Bo Liu and Matthieu Geist and Wen Dong and Saad Biaz and Qi Wang},
  journal= {arXiv preprint arXiv:2006.03978},
  year   = {2021}
}

备注

IEEE Transactions on Neural Networks and Learning Systems (IEEE-TNNLS). arXiv admin note: text overlap with arXiv:1704.05147