中文

理解行为度量学习:在干扰性强化学习环境中的大规模研究

机器学习 2025-09-10 v2 人工智能

摘要

状态抽象的一种关键方法是在观测空间中近似行为度量(特别是互模拟度量),并将这些学习到的距离嵌入到表示空间中。如先前工作所示,虽然这对任务无关噪声的鲁棒性很有前景,但准确估计这些度量仍然具有挑战性,需要各种设计选择,从而在理论和实践之间产生差距。先前的评估主要关注最终回报,使得学习度量的质量和性能提升的来源不明确。为了系统地评估度量学习在深度强化学习(RL)中的工作原理,我们评估了五种最近的方法,在概念上统一为具有不同设计选择的等距嵌入。我们在 20 个基于状态的任务和 14 个基于像素的任务上对它们与基线进行了基准测试,涵盖具有不同噪声设置的 370 种任务配置。除了最终回报之外,我们引入了对去噪因子的评估,以量化编码器过滤干扰的能力。为了进一步隔离度量学习的效果,我们提出并评估了一种隔离度量估计设置,其中编码器仅受度量损失的影响。最后,我们发布了一个开源的、模块化的代码库,以提高可复现性并支持未来关于深度 RL 中度量学习的研究。

关键词

引用

@article{arxiv.2506.00563,
  title  = {Understanding Behavioral Metric Learning: A Large-Scale Study on Distracting Reinforcement Learning Environments},
  author = {Ziyan Luo and Tianwei Ni and Pierre-Luc Bacon and Doina Precup and Xujie Si},
  journal= {arXiv preprint arXiv:2506.00563},
  year   = {2025}
}