中文

平均奖励拟合Q迭代的有限时间界限

机器学习 2025-10-21 v1

摘要

尽管存在大量工作阐述了折扣回报离线强化学习在函数逼近下的样本复杂度,但关于平均奖励设置的先前工作关注 significantly 不足,现有方法依赖限制性假设,如平稳性或MDP的线性性。本文首次为弱通信MDP下的平均奖励离线强化学习建立样本复杂度结果,假设条件较为温和。为此,我们引入锚定拟合Q迭代(Anchored Fitted Q-Iteration),将标准拟合Q迭代与锚机制相结合。我们表明,锚机制可被解释为一种权重衰减,对在平均奖励设置下实现有限时间分析至关重要。我们还扩展了有限时间分析至数据来源于单轨迹而非独立同分布转移的情形,同样利用锚机制。

关键词

引用

@article{arxiv.2510.17391,
  title  = {Finite-Time Bounds for Average-Reward Fitted Q-Iteration},
  author = {Jongmin Lee and Ernest K. Ryu},
  journal= {arXiv preprint arXiv:2510.17391},
  year   = {2025}
}