中文

重新审视强化学习中鲁棒表示的双模拟度量

机器学习 2025-09-23 v2

摘要

双模拟度量长期以来被视为各种强化学习任务中一种有效的与控制相关的表示学习技术。然而,在本文中,我们指出了传统双模拟度量的两个主要问题:1)无法表示某些区分性场景,以及2)在递归更新中依赖于奖励差异和后续状态差异的预定义权重。我们发现第一个问题源于奖励差距定义的不精确,而第二个问题则源于忽视了奖励差异和下一状态区分在不同训练阶段和任务设置中的重要性变化。为解决这些问题,通过引入状态-动作对的度量,我们提出了一种修正的双模拟度量,其具有更精确的奖励差距定义和带有自适应系数的新型更新算子。我们还为所提出的度量及其改进的表示区分性提供了收敛性的理论保证。除了严格的理论分析外,我们在两个代表性基准测试DeepMind Control和Meta-World上进行了大量实验,证明了我们方法的有效性。

关键词

引用

@article{arxiv.2507.18519,
  title  = {Revisiting Bisimulation Metric for Robust Representations in Reinforcement Learning},
  author = {Leiji Zhang and Zeyu Wang and Xin Li and Yao-Hui Li},
  journal= {arXiv preprint arXiv:2507.18519},
  year   = {2025}
}