填空:稀疏奖励环境下使用少量演示加速 Q 学习
机器学习
2025-10-29 v1
摘要
稀疏奖励环境中的强化学习(RL)由于缺乏有信息的反馈,仍然是一个重大的挑战。我们提出一种简单而有效的方法,使用少量成功演示来初始化 RL 代理的值函数。通过预计算来自离线演示的值估计并将其用作早期学习的目标,我们的方法为代理提供了一个对有前景动作的有用先验。代理随后通过标准的在线交互来细化这些估计。这种混合的离线到在线范式显著减少了探索负担,并在稀疏奖励环境中提高了样本效率。基准任务上的实验表明,我们的方法加快了收敛速度,并甚至在最小或次优演示数据的情况下超越了标准基线。
引用
@article{arxiv.2510.24432,
title = {Fill in the Blanks: Accelerating Q-Learning with a Handful of Demonstrations in Sparse Reward Settings},
author = {Seyed Mahdi Basiri Azad and Joschka Boedecker},
journal= {arXiv preprint arXiv:2510.24432},
year = {2025}
}