中文

DreamSmooth:通过奖励平滑改进基于模型的强化学习

机器学习 2024-02-20 v2 人工智能 机器人学

摘要

基于模型的强化学习(MBRL)因能以样本高效的方式学习复杂行为而备受关注:通过用预测奖励生成想象轨迹来规划动作。尽管取得了成功,我们惊讶地发现,奖励预测常常是MBRL的瓶颈,尤其是对于难以(甚至模糊)预测的稀疏奖励。受人类能从粗略奖励估计中学习的直觉启发,我们提出一种简单而有效的奖励平滑方法DreamSmooth,它学习预测时间平滑后的奖励,而非给定时间步上的精确奖励。我们通过经验表明,DreamSmooth在长视野稀疏奖励任务上的样本效率和最终性能均达到最先进水平,且在常见基准(如Deepmind Control Suite和Atari基准)上不损失性能。

关键词

引用

@article{arxiv.2311.01450,
  title  = {DreamSmooth: Improving Model-based Reinforcement Learning via Reward Smoothing},
  author = {Vint Lee and Pieter Abbeel and Youngwoon Lee},
  journal= {arXiv preprint arXiv:2311.01450},
  year   = {2024}
}

备注

For code and website, see https://vint-1.github.io/dreamsmooth/