中文

通用值函数不确定性

机器学习 2025-06-03 v2 人工智能 机器学习

摘要

估计值函数中的认知不确定性是强化学习(RL)诸多方面的关键挑战,包括高效探索、安全决策和离线RL。深度集成提供了一种量化值不确定性的稳健方法,但伴随着显著的计算开销。单模型方法虽在计算上更具优势,但通常依赖启发式方法,且一般需要额外的传播机制来获取短视不确定性估计。在本工作中,我们引入了通用值函数不确定性(UVU),其精神与随机网络蒸馏(RND)类似,通过在线学习器与固定的随机初始化目标网络之间的平方预测误差来量化不确定性。与RND不同,UVU误差反映了策略条件下的值不确定性,包含了任何给定策略可能遇到的未来不确定性。这源于UVU采用的训练过程:在线网络使用时序差分学习进行训练,其合成奖励源自固定的随机初始化目标网络。我们利用神经正切核(NTK)理论对我们的方法进行了广泛的理论分析,并证明在网络宽度趋于无穷的极限下,UVU误差精确等价于独立通用值函数集成的方差。实验表明,在具有挑战性的多任务离线RL环境中,UVU取得了与大规模集成相当的性能,同时具备简单性并大幅节省了计算开销。

关键词

引用

@article{arxiv.2505.21119,
  title  = {Universal Value-Function Uncertainties},
  author = {Moritz A. Zanger and Max Weltevrede and Yaniv Oren and Pascal R. Van der Vaart and Caroline Horsch and Wendelin Böhmer and Matthijs T. J. Spaan},
  journal= {arXiv preprint arXiv:2505.21119},
  year   = {2025}
}