中文

EUBRL:以认识不确定性导向的贝叶斯强化学习

计算物理 2025-12-18 v1

摘要

在已知与未知的边界处,智能体不可避免地要面临在探索与利用之间做出选择。认识不确定性反映了这些边界,代表由于知识有限而产生的系统性不确定性。本文提出了一种贝叶斯强化学习(RL)算法,名为EUBRL,通过认识引导实现原则化的探索。该引导能够适应性地减少因估计误差导致的每一步后悔。我们为足够表达性的先验在无限期折扣MDP中建立了近乎最小混沌的后悔和样本复杂度保证。实验上,我们在稀疏奖励、长期 horizons 以及随机性的任务上评估了EUBRL。结果表明,EUBRL在样本效率、可扩展性和一致性方面均表现出色。

关键词

引用

@article{arxiv.2512.15406,
  title  = {UGKS and UGKWP Methods for Multiscale Simulation of Electrostatic Plasma in Quasineutral and Hydrodynamic Limits},
  author = {Zhigang Pu and Kun Xu},
  journal= {arXiv preprint arXiv:2512.15406},
  year   = {2025}
}