中文

基于极大加线性近似的拟合 Q 迭代

最优化与控制 2025-03-11 v3 人工智能 机器学习 系统与控制 系统与控制

摘要

在本研究中,我们考虑在折扣 Markov 决策过程的离线强化学习中,将极大加线性近似器应用于 Q 函数。特别地,我们结合这些近似器提出了具有可证明收敛性的新型拟合 Q 迭代(FQI)算法。利用 Bellman 算子与极大加运算的兼容性,我们证明了所提出 FQI 算法每次迭代中的极大加线性回归可归结为简单的极大加矩阵-向量乘法。我们还考虑了所提出算法的变分实现,从而使得每次迭代的复杂度与样本数量无关。

关键词

引用

@article{arxiv.2409.08422,
  title  = {Fitted Q-Iteration via Max-Plus-Linear Approximation},
  author = {Y. Liu and M. A. S. Kolarijani},
  journal= {arXiv preprint arXiv:2409.08422},
  year   = {2025}
}