高维 Tensor-Efficient Q 学习
机器学习
2026-04-09 v2 系统与控制
系统与控制
摘要
高维强化学习(RL) 在大状态-动作空间中面临复杂计算和样本效率低下的挑战。Q 学习算法在维度灾难下尤为困难,该灾难导致状态-动作对数随问题规模指数增长。虽然深度 Q 网络等神经网络方法取得了成功,但未充分利用问题结构。许多高维控制任务在其价值函数中表现出低秩结构,张量基方法通过低秩分解提供了参数高效的表示。然而,现有基于张量的 Q 学习方法侧重于表示保真度,未利用该结构进行探索。我们提出了 Tensor-Efficient Q 学习 (TEQL),将 Q 函数表示为离散化状态-动作空间上的低秩 CP 张量,并利用张量结构进行不确定性感知探索。TEQL 集成了误差-不确定性引导探索 (EUGE),该方法将张量逼近误差与访问计数相结合以指导动作选择,同时引入频率感知正则化以稳定更新。在相同参数预算下,经典控制任务上的实验表明,TEQL 在样本效率方面优于基于矩阵的低秩方法和深度 RL 方法,适用于采样成本高的资源受限应用。
引用
@article{arxiv.2511.03595,
title = {Tensor-Efficient High-Dimensional Q-learning},
author = {Junyi Wu and Dan Li},
journal= {arXiv preprint arXiv:2511.03595},
year = {2026}
}
备注
61 pages, 7 figures. v2 updated to include additional experimental results and refined proofs