TabQL:基于表格基础模型的原地 Q 学习
机器学习
2026-05-20 v1
摘要
我们提出 Tabular Q-Learning (TabQL),这是一种强化学习框架,取代深度 Q 学习 (DQN) 中常规参数化 Q 网络的做法,采用具备原地学习能力的表格型基础模型。核心思想是通过序列到序列基础模型在表格化的状态-动作-Q 值元组上运行,代表 Q 值,从而能够通过对最近经验的条件化实现快速适应。TabQL 不同于经典 DQN,利用 (i) 通过原地更新实现零或少量样本的 Q 值推断,以及 (ii) 使用标准 DQN 进行热身阶段以引导高质量上下文。特别地,通过执行 TabQL 输出的动作并使用 DQN 预测的 Q 值生成新转移,来增强上下文质量。我们形式化了 TabQL,对其收敛性和样本复杂度进行分析,并表明 TabQL 在轻度假设下与 vanilla Q-learning 和带原地学习的 DQN 之间进行插值。我们的分析表明,TabQL 通过在原地学习中摊销 Bellman 更新,实现了相对于 DQN 更高的效率。大量基准实验结果展示了所提出 TabQL 的有效性与实效性。
引用
@article{arxiv.2605.18979,
title = {TabQL: In-Context Q-Learning with Tabular Foundation Models},
author = {Qisai Liu and Zhanhong Jiang and Timilehin Ayanlade and Ashutosh Kumar Nirala and Yang Li and Aditya Balu and Soumik Sarkar},
journal= {arXiv preprint arXiv:2605.18979},
year = {2026}
}