中文

基于不确定性的少样本示范强化学习平滑策略正则化

机器学习 2025-11-03 v2 人工智能 机器人学 机器学习

摘要

在稀疏奖励的强化学习中,示范可以加速学习,但何时模仿示范仍具挑战性。我们提出了基于示范的平滑策略正则化(SPReD),这是一个解决基本问题的框架:智能体何时应模仿示范,何时应遵循自身策略?SPReD 使用集成方法显式建模示范动作和策略动作的 Q 值分布,通过量化不确定性进行比较。我们开发了两种互补的不确定性感知方法:一种估计示范优越性似然的概率方法,以及一种按统计显著性缩放模仿的优势方法。与做出二元模仿决策的主流方法(如 Q-filter)不同,SPReD 应用连续的、与不确定性成正比的正则化权重,减少了训练期间的梯度方差。尽管计算简单,SPReD 在八项机器人任务的实验中取得了显著收益,在复杂任务中性能比现有方法高出 14 倍,同时对示范的质量和数量保持鲁棒性。我们的代码可在 https://github.com/YujieZhu7/SPReD 获取。

关键词

引用

@article{arxiv.2509.15981,
  title  = {Uncertainty-Based Smooth Policy Regularisation for Reinforcement Learning with Few Demonstrations},
  author = {Yujie Zhu and Charles A. Hepburn and Matthew Thorpe and Giovanni Montana},
  journal= {arXiv preprint arXiv:2509.15981},
  year   = {2025}
}