通过麦克莱恩展开稳定极端 Q 学习
机器学习
2025-02-12 v2 人工智能
摘要
在离线强化学习中,基于样本内学习方法广泛用于防止因评估数据集外分布动作而导致的性能下降。极端 Q 学习 (XQL) 采用基于 Bellman 误差服从 Gumbel 分布假设的损失函数,使其能够以样本内方式建模软最优值函数。它在离线与在线强化学习环境中表现出色。然而,损失函数中的指数项仍导致不稳定,且模型误差分布偏离 Gumbel 分布的风险仍存。因此,我们提出通过麦克莱恩展开的极端 Q 学习以提升稳定性。在该方法中,对 XQL 中损失函数的麦克莱恩展开可增强对大误差的稳健性。该方法涉及在行为策略下的值函数与软最优值函数之间进行调整,从而根据展开阶数实现稳定性与最优性之间的权衡。它还允许将误差分布假设从正态分布调整为 Gumbel 分布。我们的方法显著稳定了在 DM Control 上的在线 RL 任务(此前 XQL 在该任务中不稳定),并在 D4RL 多个离线 RL 任务中提升了性能。
引用
@article{arxiv.2406.04896,
title = {Stabilizing Extreme Q-learning by Maclaurin Expansion},
author = {Motoki Omura and Takayuki Osa and Yusuke Mukuta and Tatsuya Harada},
journal= {arXiv preprint arXiv:2406.04896},
year = {2025}
}
备注
Accepted at RLC 2024: The first Reinforcement Learning Conference