中文

基于目标相关经验的测试时离线强化学习

机器学习 2026-05-14 v2

摘要

基础模型通过单个大型神经网络压缩了大量信息,可针对单个任务进行查询。这种广泛框架与离线目标条件强化学习算法之间存在强烈的相似性:训练大量目标的通用价值函数,并在每个测试剧集中针对单个目标评估策略。基础模型的广泛研究表明,通过测试时训练可显著提升性能,将模型针对当前目标进行专业化。我们发现,针对与测试目标相关的经验进行测试时离线强化学习也能在计算成本适中的情况下获得显著更好的策略。我们提出了一种新颖的自监督数据选择准则,根据其对当前状态的相关性和对评估目标的质量,从离线数据集中选择转换。我们在广泛的高维位置-导航和操控任务上演示,针对所选数据进行少量梯度步骤的微调,可显著优于标准离线预训练。我们的目标条件测试时训练(GC-TTT)算法在评估期间以滚动时域的方式应用此例程,正在滚动 rollout 时适应当前轨迹。最后,我们研究了推断时的计算资源分配,表明在可比的成本下,GC-TTT 产生的性能提升无法通过扩大模型规模实现。

关键词

引用

@article{arxiv.2507.18809,
  title  = {Test-time Offline Reinforcement Learning on Goal-related Experience},
  author = {Marco Bagatella and Mert Albaba and Jonas Hübotter and Georg Martius and Andreas Krause},
  journal= {arXiv preprint arXiv:2507.18809},
  year   = {2026}
}