中文

通过时序差分误差最大化在多样化奖励设置中学习探索

机器学习 2025-10-22 v2

摘要

针对深度强化学习中的探索问题,已提出众多启发式方法和高级方法。基于噪声的探索通常在稠密奖励设置中表现良好,而基于奖励的探索在稀疏奖励设置中表现良好。然而,这些方法通常需要额外的调整来处理不理想的奖励设置,通过调整超参数和噪声分布。积极抑制探索的奖励(即带有动作成本且没有其他稠密信号可供遵循)可能构成重大挑战。我们提出了一种新颖的探索方法——稳定误差寻求探索(Stable Error-seeking Exploration, SEE),它在稠密、稀疏和探索厌恶的奖励设置中均具有鲁棒性。为此,我们重新审视了将时序差分(TD)误差最大化作为独立目标的思想。我们的方法引入了三个设计选择,以缓解由远策略学习引起的不稳定性、在回合制设置中最大化累积 TD 误差的利益冲突,以及 TD 误差的非平稳性。SEE 可以与离线策略算法结合使用,而无需修改原始目标的优化流水线。在我们的实验分析中,我们表明带有 SEE 附加的软演员评论家(Soft-Actor Critic)智能体在多种任务的三个多样化奖励设置中均表现鲁棒,无需超参数调整。

关键词

引用

@article{arxiv.2506.13345,
  title  = {Learning to Explore in Diverse Reward Settings via Temporal-Difference-Error Maximization},
  author = {Sebastian Griesbach and Carlo D'Eramo},
  journal= {arXiv preprint arXiv:2506.13345},
  year   = {2025}
}