基于潜在类比的组合化传递:离线目标条件强化学习中的组合泛化
机器学习
2026-05-21 v1
摘要
在离线目标条件强化学习(GCRL)中,实现对新情境下未见目标的组合泛化至关重要,而从有限数据中学习通用目标-reaching智能体。大多数先前方法通过在时间连续片段上进行轨迹拼接来实现此目标,这限制了在不同情境之间组合行为。为克服这一限制,我们将类比传递形式化为通过将任务内生类比与给定情境组合以合成新计划,并提出一种针对该任务的新型类比表示。基于我们的理论,该类比表示捕捉了在最优任务执行下发生的变化,保持对情境变异的不变性,并且足以实现最优的目标到达。我们进一步认为,向未见的类比-情境对进行泛化是类比传递中的实际障碍,我们引入一种新的方法,用于离线GCRL,使能够超越已见配对实现类比传递。我们在OGBench操控环境上进行了实验,显著优于不进行类比传递的先前方法。项目页面:https://rllab-snu.github.io/projects/CTA/
关键词
引用
@article{arxiv.2605.20609,
title = {Compositional Transduction with Latent Analogies for Offline Goal-Conditioned Reinforcement Learning},
author = {Junseok Kim and Dohyeong Kim and Mineui Hong and Songhwai Oh},
journal= {arXiv preprint arXiv:2605.20609},
year = {2026}
}
备注
ICML 2026