基于极大加线性近似的拟合 Q 迭代
最优化与控制
2025-03-11 v3 人工智能
机器学习
系统与控制
系统与控制
摘要
在本研究中,我们考虑在折扣 Markov 决策过程的离线强化学习中,将极大加线性近似器应用于 Q 函数。特别地,我们结合这些近似器提出了具有可证明收敛性的新型拟合 Q 迭代(FQI)算法。利用 Bellman 算子与极大加运算的兼容性,我们证明了所提出 FQI 算法每次迭代中的极大加线性回归可归结为简单的极大加矩阵-向量乘法。我们还考虑了所提出算法的变分实现,从而使得每次迭代的复杂度与样本数量无关。
引用
@article{arxiv.2409.08422,
title = {Fitted Q-Iteration via Max-Plus-Linear Approximation},
author = {Y. Liu and M. A. S. Kolarijani},
journal= {arXiv preprint arXiv:2409.08422},
year = {2025}
}