中文

基于K步前瞻阈值排序的快速非终态有限时序强化学习

机器学习 2026-02-03 v1 机器学习

摘要

在非终态、有限时序MDP的在线强化学习仍未得到充分探索,面临需估计至固定终止时间的回报这一挑战。现有无限时序方法往往依赖折扣收缩,难以自然地考虑这种固定时序结构。我们提出一种修改Q函数:不针对完整时序,而是学习K步前瞻Q函数,将规划截断至下一步K步。为进一步提升样本效率,我们引入阈值机制:仅当其估计的K步前瞻价值超过随时间变化的阈值时,才选择动作。我们提供一种高效的表格学习算法,证明其实现快速有限样本收敛:K=1时达到最小混沌常数 regret,K≥2时达到O(max((K1),CK1)SATlog(T))\mathcal{O}(\max((K-1),C_{K-1})\sqrt{SAT\log(T)})的regret。我们对算法在奖励最大化目标下的性能进行数值评估。我们的实现会自适应增加K,以平衡前瞻深度与估计方差。实证结果显示,在JumpRiverswim、FrozenLake和AnyTrading等合成MDP和RL环境中, our algorithm 在累积奖励方面优于最先进的表格强化学习方法。

关键词

引用

@article{arxiv.2602.00781,
  title  = {Fast Non-Episodic Finite-Horizon RL with K-Step Lookahead Thresholding},
  author = {Jiamin Xu and Kyra Gan},
  journal= {arXiv preprint arXiv:2602.00781},
  year   = {2026}
}