中文

EVAL:基于特征向量的平均奖励学习

机器学习 2025-01-20 v1 人工智能

摘要

在强化学习中,文献中已对两种目标函数进行了广泛研究:折扣奖励和平均奖励。将其推广至熵正则化设置提升了这两者的鲁棒性和探索能力。最近,表格设置下的熵正则化平均奖励问题通过大偏差理论工具得到了解决。该方法具有线性优势,可通过单一矩阵的性质同时获得最优策略和平均奖励率。在本文中,我们通过开发基于神经网络函数逼近的方法,将该框架扩展至更一般的设置。该公式揭示了 RL 中不同目标之间关系的新理论见解。此外,我们将算法与后验策略迭代方案相结合,展示了我们的方法如何在不进行熵正则化的情况下解决平均奖励 RL 问题。使用经典控制基准,我们在实验中发现,我们的方法在稳定性和收敛速度方面优于其他算法。

关键词

引用

@article{arxiv.2501.09770,
  title  = {EVAL: EigenVector-based Average-reward Learning},
  author = {Jacob Adamczyk and Volodymyr Makarenko and Stas Tiomkin and Rahul V. Kulkarni},
  journal= {arXiv preprint arXiv:2501.09770},
  year   = {2025}
}

备注

Accepted at the AAAI-25 8th Workshop on Generalization in Planning. arXiv admin note: text overlap with arXiv:2501.09080