不确定性感知的秩一 MIMO Q 网络框架:加速离线强化学习
机器学习
2026-02-24 v1 机器人学
摘要
离线强化学习 (RL) 因其安全且易于扩展的范式而受到广泛关注。然而,在该范式下训练面临自身挑战:来自超出分布 (OOD) 数据的外推误差。现有方法通过对 OOD Q 值进行惩罚或对所学策略与行为策略施加相似性约束等手段来解决此问题,但这些方法常受到局限,如对 OOD 数据的保守利用、对 OOD 数据表征的不精确以及显著的计算开销。为解决这些挑战,本文引入了一种不确定性感知的秩一多输入多输出 (MIMO) Q 网络框架。该框架旨在通过完全利用 OOD 数据的潜力,同时确保学习过程的效率,来增强离线强化学习。具体而言,该框架量化数据不确定性并在训练损失中加以利用,旨在训练一个最大化其相应 Q 函数下置信区间的策略。此外,引入一种秩一 MIMO 架构来建模不确定性感知 Q 函数,\TP{其在与集成网络相当的不确定性量化能力方面具有优势,但计算成本几乎仅相当于单个网络的成本}。因此,该框架在精度、速度和内存效率之间取得了和谐的平衡,最终实现了更好的整体性能。对 D4RL 基准进行的广泛实验表明,该框架在保持计算高效的同时实现了最新的性能。通过纳入不确定性量化的概念,我们的框架为缓解外推误差并提高离线 RL 的效率提供了一条有前景的道路。
引用
@article{arxiv.2602.19917,
title = {Uncertainty-Aware Rank-One MIMO Q Network Framework for Accelerated Offline Reinforcement Learning},
author = {Thanh Nguyen and Tung Luu and Tri Ton and Sungwoong Kim and Chang D. Yoo},
journal= {arXiv preprint arXiv:2602.19917},
year = {2026}
}
备注
10 pages, 4 Figures, IEEE Access