Q-WSL: 基于动态规划优化目标条件强化学习的加权监督学习
机器学习
2025-06-10 v5
摘要
近期涌现出一类新型先进算法,称为目标条件加权监督学习(GCWSL),用于解决目标条件强化学习(RL)中稀疏奖励所面临的挑战。GCWSL 因其简单、有效和稳定,在多样化的目标到达任务中持续提供优异性能。然而,GCWSL 方法缺乏称为轨迹拼接的关键能力,该能力对于在测试时面对未见技能时学习最优策略至关重要。当回放缓冲区主要由次优轨迹充满时,这一限制尤为突出。相较之下,利用动态规划的传统 TD 基于 RL 方法(如 Q 学习)则不受此问题困扰,但常因价值函数近似的内在困难而导致不稳定。本文提出 Q-learning 加权监督学习(Q-WSL),一种新型框架旨在通过融合 Q 学习中动态规划的优势来克服 GCWSL 的局限性。Q-WSL 利用动态规划结果输出跨不同轨迹中 (状态,目标) 对的最优动作。该方法融合了 Q 学习和 GCWSL 的优势,有效缓解了两者的各自弱点,显著提升整体性能。在具有挑战性的目标到达任务上的实证评估表明,Q-WSL 在性能和样本效率方面均优于其他目标条件方法。此外,Q-WSL 在二元奖励结构和环境随机性特征下的鲁棒性尤为突出。
引用
@article{arxiv.2410.06648,
title = {Q-WSL: Optimizing Goal-Conditioned RL with Weighted Supervised Learning via Dynamic Programming},
author = {Xing Lei and Xuetao Zhang and Zifeng Zhuang and Donglin Wang},
journal= {arXiv preprint arXiv:2410.06648},
year = {2025}
}