中文

是的,Q-learning 有助于离线情境强化学习

机器学习 2026-05-27 v4 人工智能

摘要

现有的离线情境强化学习 (ICRL) 方法主要依赖监督训练目标,而这类目标在离线强化学习环境中已知存在局限性。本研究探索了在离线 ICRL 框架中集成 RL 目标的可行性。通过在超过 150 个基于 GridWorld 和 MuJoCo 环境构建的数据集上进行实验,我们展示,针对 RL 目标进行优化相较于广泛采用的算法蒸馏 (Algorithm Distillation, AD) 方法,平均性能提升约 30%,且在 various dataset coverages, structures, expertise levels, and environmental complexities 的不同数据集覆盖率、结构、专业程度和环境复杂性下均表现出色。此外,在具有挑战性的 XLand-MiniGrid 环境中,RL 目标的应用将 AD 的性能提升了一倍。我们的研究结果还表明,在价值学习过程中引入保守性(conservatism)可在几乎所有测试环境中带来额外的性能提升。我们的发现强调了将 ICRL 学习目标与 RL 奖励最大化目标对齐的重要性,并表明离线强化学习是推动 ICRL 发展的有前景的方向。

关键词

引用

@article{arxiv.2502.17666,
  title  = {Yes, Q-learning Helps Offline In-Context RL},
  author = {Denis Tarasov and Alexander Nikulin and Ilya Zisman and Albina Klepach and Andrei Polubarov and Nikita Lyubaykin and Alexander Derevyagin and Igor Kiselev and Vladislav Kurenkov},
  journal= {arXiv preprint arXiv:2502.17666},
  year   = {2026}
}