中文

面向目标条件强化学习的多尺度预测表示

机器学习 2026-05-12 v1

摘要

本文研究了离线目标条件强化学习(GCRL)中的鲁棒表示学习。特别是在稀疏奖励场景中,学习对齐状态与目标潜空间的表示是一项挑战,这往往导致表示发散,即编码器漂移到一个低维的、与目标无关的子空间,从而破坏策略学习的稳定性。我们通过证明智能体必须在多个尺度上获得对其环境的根本理解(从局部物理动力学到长程目标导向结构)来解决这一问题。基于这一洞察,我们提出了 Ms.PR,这是一个利用多尺度预测监督来在潜空间内强制执行目标导向对齐的框架。我们证明 Ms.PR 带来了表示质量的提升,并在视觉和基于状态的任务上均表现出强大的性能。此外,我们表明我们的方法在现实且具挑战性的数据机制下具有出色的韧性,在多种任务、轨迹拼接场景和极端噪声条件下均保持着 SOTA 性能。

关键词

引用

@article{arxiv.2605.09364,
  title  = {Multi-scale Predictive Representations for Goal-conditioned Reinforcement Learning},
  author = {Valliappan Chidambaram Adaikkappan and David Meger and Sai Rajeswar and Pietro Mazzaglia},
  journal= {arXiv preprint arXiv:2605.09364},
  year   = {2026}
}