中文

离线目标条件化强化学习中超参数的良性情况研究

机器学习 2026-02-06 v1

摘要

深度强化学习(RL)中超参数敏感性常被视为不可避免,但究竟是 RL 问题固有的特性,还是特定训练机制放大的结果,尚不明确。我们在离线目标条件化 RL 中进行研究,其中数据分布是固定的,可通过数据质量计划性迁移显式控制非平稳性。此外,我们研究了在平稳和非平稳情形下的数据质量变化,并覆盖两个具有代表性的算法:HIQL(引导 TD 学习)和 QRL(准度表示学习)。总体而言,我们观察到即使在受控非平稳条件下,离线 RL 对超参数配置变化的鲁棒性远大于人们在在线 RL 中常见的报告。当掌握适度专家数据(约 20%)时,QRL 能保持广泛、稳定的接近最优区域,而 HIQL 则表现出锐利的最优点,在不同训练阶段会发生显著漂移。为解释这种差异,我们引入一种目标间梯度对齐诊断工具。我们发现,基于引导的目标函数存在更强的破坏性梯度干扰,这与超参数敏感性直接相关。这些结果表明,RL 在训练过程中对超参数配置变化的高度敏感性并非不可避免,但是由引导机制动力学所放大,为通向更稳健算法目标设计提供了可能。

关键词

引用

@article{arxiv.2602.05459,
  title  = {When Are RL Hyperparameters Benign? A Study in Offline Goal-Conditioned RL},
  author = {Jan Malte Töpperwien and Aditya Mohan and Marius Lindauer},
  journal= {arXiv preprint arXiv:2602.05459},
  year   = {2026}
}

备注

27 pages, 19 figures