中文

双目标表示

机器学习 2026-02-17 v2 人工智能

摘要

本文介绍了用于目标条件强化学习(GCRL)的双目标表示方法。双目标表示将一个状态定义为"所有其他状态到该状态的时序距离集合";换言之,它通过测量状态之间的时序距离来编码其与其他状态的关系。该表示具有若干令人满意的理论属性。首先,它仅依赖于环境的内在动力学,对于原始状态表示具有不变性。其二,它包含了足以恢复最优目标到达策略的充分信息,同时能够过滤掉外源性噪声。基于此概念,我们开发了一种可与任何现有GCRL算法结合的实用目标表示学习方法。通过在OGBench任务套中进行多样化实验,我们经验性地表明,双目标表示在20个基于状态和基于像素的任务中均能持续性地提高离线目标到达性能。

关键词

引用

@article{arxiv.2510.06714,
  title  = {Dual Goal Representations},
  author = {Seohong Park and Deepinder Mann and Sergey Levine},
  journal= {arXiv preprint arXiv:2510.06714},
  year   = {2026}
}

备注

ICLR 2026