中文

具有可学习基函数的深度贝叶斯强化学习中的广义线性模型

机器学习 2026-05-11 v3 人工智能 机器人学

摘要

贝叶斯强化学习(BRL)是元强化学习(Meta-RL)的一个子类,它通过将贝叶斯任务参数显式地纳入转移和奖励模型,为泛化提供了一个原则性框架。然而,经典的 BRL 方法假设转移和奖励模型的形式已知。尽管最近的深度 BRL 方法结合了模型学习来解决这个问题,但将神经网络直接应用于联合数据和任务参数需要变分推断。这通常会产生不清晰的任务表示,从而损害生成的 BRL 策略。为了克服这些限制,我们引入了具有可学习基函数的深度贝叶斯强化学习中的广义线性模型(GLiBRL)。我们的方法具有对任务参数和模型噪声的完全可处理的贝叶斯推断,以及用于学习转移和奖励模型的精确边际似然评估。GLiBRL 中精确贝叶斯推断的排列不变性使其能够与在线策略和离线策略 RL 算法无缝集成。我们进一步证明,GLiBRL 在其任务表示的 L2 距离与任务样本之间基于经验核的对应关系之间具有一个闭式关系,据我们所知,这是在线深度 BRL 的第一个此类结构性结果。GLiBRL 与具有代表性的和最近的 Meta-RL 方法进行了比较,在 MuJoCo 和 MetaWorld 基准测试上,将最先进的性能提升了高达 1.8 倍。

关键词

引用

@article{arxiv.2512.20974,
  title  = {Generalised Linear Models in Deep Bayesian RL with Learnable Basis Functions},
  author = {Jingyang You and Hanna Kurniawati},
  journal= {arXiv preprint arXiv:2512.20974},
  year   = {2026}
}