基于高斯过程似然估计的奖励再分配
机器学习
2025-11-18 v2 机器人学
摘要
在许多实际的强化学习任务中,反馈仅在长时间段结束时提供,导致奖励稀疏且延迟。现有的奖励再分配方法通常假设每一步的奖励是独立的,从而忽略了状态-动作对之间的相互依赖性。本文提出了一种基于高斯过程的似然奖励再分配 (GP-LRR) 框架,通过将奖励函数建模为来自高斯过程的样本,显式地通过核函数捕获状态-动作对之间的依赖性。通过最大化观测回合总报酬的似然值,并采用留一法策略利用整个轨迹,我们的框架本质上引入了不确定性正则化。此外,我们展示了当使用不含观测噪声的退化核时,常规基于均方误差 (MSE) 的奖励再分配方法可作为我们 GP-LRR 框架的特例。当与诸如 Soft Actor-Critic 等离策略算法集成时,GP-LRR 可产生稠密且信息丰富的奖励信号,使其在几个 MuJoCo 基准测试中实现更高的样本效率和策略性能。
引用
@article{arxiv.2503.17409,
title = {Reward Redistribution via Gaussian Process Likelihood Estimation},
author = {Minheng Xiao and Xian Yu},
journal= {arXiv preprint arXiv:2503.17409},
year = {2025}
}
备注
Accepted by AAAI-26