学习状态值的时序间隔方法分析
机器学习
2025-09-05 v2 人工智能
摘要
时序间隔(TD)学习的标志性特征是自我校准:使用价值预测来生成新的价值预测。TD 方法的绝大多数控制算法都是通过单一动作价值函数进行自我校准学习策略(如 Q 学习和 Sarsa)。相对于学习两个非对称价值函数以进行自我校准的方法(即学习状态价值作为学习动作价值的中间步骤的方法),关注程度显著不足。现有算法可分为 QV 学习或 AV 学习两类。尽管这些算法在先前工作中被研究过一些,但仍不清楚学习两个价值函数而非仅一个是否有利,以及这种方法在一般情况下是否是理论上可靠的。本文以收敛性和样本效率为分析标准,考察了这些算法族。我们发现,尽管两族方法在预测设置下都比 Expected Sarsa更有效,但只有 AV 学习方法在控制设置下相对于 Q 学习具有显著优势。最后,我们引入了一种新的 AV 学习算法称为正则化 Dueling Q 学习(RDQ),在 MinAtar 基准中显著优于 Dueling DQN。
引用
@article{arxiv.2507.09523,
title = {An Analysis of Action-Value Temporal-Difference Methods That Learn State Values},
author = {Brett Daley and Prabhat Nagarajan and Martha White and Marlos C. Machado},
journal= {arXiv preprint arXiv:2507.09523},
year = {2025}
}
备注
Published in RLC/RLJ 2025. Camera-ready version