中文

SLOPE:基于乐观潜力景观塑造的模型基强化学习

机器学习 2026-05-11 v3

摘要

基于模型的强化学习(MBRL)在样本效率方面表现出色,但在稀疏奖励环境中难以应对。一个关键瓶颈在于,稀疏环境中缺乏信息丰富的梯度,标准奖励模型往往产生平坦的奖励景观,难以指导规划。为此,我们提出了以乐观潜力估计塑造景观的新框架(SLOPE),将奖励建模从预测稀疏标量转向构建信息丰富的潜力景观。SLOPE 采用乐观分布回归来估计高置信度的上界,从而放大稀有的成功信号,确保充分的探索梯度。在30多个任务上测试了5个基准数据集以及实际机器人部署,结果表明,SLOPE 在完全稀疏、半稀疏和稠密奖励环境下均一致优于领先的基线方法。

关键词

引用

@article{arxiv.2602.03201,
  title  = {SLOPE: Optimistic Potential Landscape Shaping for Model-based Reinforcement Learning},
  author = {Yao-Hui Li and Zeyu Wang and Xin Li and Wei Pang and Yingfang Yuan and Zhengkun Chen and Boya Zhang and Riashat Islam and Alex Lamb and Yonggang Zhang},
  journal= {arXiv preprint arXiv:2602.03201},
  year   = {2026}
}

备注

Work in progress