参数化投影贝尔曼算子
机器学习
2024-03-07 v3 人工智能
摘要
近似值迭代是强化学习中的一类算法,旨在获得最优值函数的近似。通常,近似值迭代算法实现一个迭代过程,每一步包括:(i) 应用贝尔曼算子,(ii) 投影到考虑的函数空间。众所周知,贝尔曼算子利用转移样本,这强烈决定了其行为,因为无信息样本可能导致可忽略的更新或漫长的绕路,其有害影响因计算密集的投影步骤而进一步加剧。为了解决这些问题,我们提出了一种新颖的替代方法,基于学习贝尔曼算子的近似版本,而不是像近似值迭代方法那样通过样本来估计它。这样,我们能够(i) 在转移样本之间进行泛化,(ii) 避免计算密集的投影步骤。因此,我们将我们的新算子称为投影贝尔曼算子。我们制定了一个优化问题来学习通用序列决策问题的投影贝尔曼算子,并在两类代表性的强化学习问题中理论分析了其性质。此外,我们从近似值迭代的角度对我们的方法进行了理论研究,并设计了算法实现,通过利用神经网络参数化在离线和在线设置中学习投影贝尔曼算子。最后,我们在几个强化学习问题上实证展示了投影贝尔曼算子相对于常规贝尔曼算子的优势。
引用
@article{arxiv.2312.12869,
title = {Parameterized Projected Bellman Operator},
author = {Théo Vincent and Alberto Maria Metelli and Boris Belousov and Jan Peters and Marcello Restelli and Carlo D'Eramo},
journal= {arXiv preprint arXiv:2312.12869},
year = {2024}
}
备注
Proceedings of the National Conference on Artificial Intelligence (AAAI-24)