中文

面向离线强化学习的基于情境的组合 Q 学习

机器学习 2026-03-19 v2 人工智能

摘要

准确估计 Q 函数是离线强化学习中的核心挑战。然而,现有方法常依赖共享的全局 Q 函数,这不足以捕捉由多样子任务组成的任务的组合结构。我们提出基于情境的组合 Q 学习(In-context Compositional Q-Learning, ICQL),这是一种离线 RL 框架,将 Q 学习表述为情境推断问题,并使用线性 Transformer 从检索的转换中自适应推断局部 Q 函数,而无需显式的子任务标签。理论上,我们在两个假设下证明了——局部 Q 函数的线性可近似性以及从检索情境中准确推断权重——ICQL 可实现 Q 函数的有界近似误差,并可实现近最优策略提取。实验方面,ICQL 在离线环境中显著提升了性能,在厨房任务中提升了最高可达 16.4%,在 MuJoCo 和 Adroit 任务中分别提升了 8.8% 和 6.3%。这些结果凸显了在上下文学习中实现稳健和组合价值估计的潜在潜力,并将 ICQL 确立为一种原则且有效的离线 RL 框架。

关键词

引用

@article{arxiv.2509.24067,
  title  = {In-Context Compositional Q-Learning for Offline Reinforcement Learning},
  author = {Qiushui Xu and Yuhao Huang and Yushu Jiang and Lei Song and Jinyu Wang and Wenliang Zheng and Jiang Bian},
  journal= {arXiv preprint arXiv:2509.24067},
  year   = {2026}
}

备注

Accepted by The Fourteenth International Conference on Learning Representations (ICLR 2026)