面向离策略强化学习的轨迹感知资格迹
机器学习
2025-12-23 v3
摘要
从多步回报中进行离策略学习对于样本高效的强化学习至关重要,但在不加剧方差的前提下抵消离策略偏差颇具挑战。经典做法是按决策修正离策略偏差:通过资格迹,在每次动作后以即时重要性采样(Importance Sampling, IS)比率对过去的时间差分误差重新加权。许多离策略算法依赖这一机制,并采用不同的协议来截断 IS 比率以抑制 IS 估计器的方差。遗憾的是,一旦某条迹被完全截断,其影响便不可逆转。这催生了同时考虑多次过往经验的信用分配策略。这些轨迹感知方法尚未得到充分分析,其理论依据仍不明确。本文中,我们提出一种可表达按决策与轨迹感知两类方法的多步算子。我们证明了该算子在表格设定下的收敛条件,为若干已有方法及众多新方法首次建立保证。最后,我们引入近期有界重要性采样(Recency-Bounded Importance Sampling, RBIS),它利用轨迹感知在离策略控制任务中跨 值表现稳健。
引用
@article{arxiv.2301.11321,
title = {Trajectory-Aware Eligibility Traces for Off-Policy Reinforcement Learning},
author = {Brett Daley and Martha White and Christopher Amato and Marlos C. Machado},
journal= {arXiv preprint arXiv:2301.11321},
year = {2025}
}
备注
ICML 2023. 18 pages, 4 figures, 1 table. Fixed off-by-1 error in Tightrope Problem