中文

用于学习可迁移表征的价值显式预训练

机器学习 2026-05-04 v3 机器人学

摘要

在各种变化中理解给定任务的视觉输入是视觉强化学习智能体面临的关键挑战。我们提出了价值显式预训练(VEP),这是一种为迁移强化学习学习可泛化表征的方法。VEP 通过训练表征使其对环境动力学和外观的变化保持不变,从而学习一个编码器,使得能够高效学习与先前学习任务具有相似目标的新任务。为了使用次优无标签示范数据(观测序列和稀疏奖励信号)预训练编码器,我们使用自监督对比损失,使模型能够基于反映任务进度的 Monte Carlo 价值估计来关联不同任务间的状态,从而产生捕捉任务目标的时间平滑表征。我们的方法与现有方法之间的主要区别在于使用了并不总能解决任务的次优无标签数据。在 Ant 运动、逼真导航模拟器和 Atari 基准上的实验表明,VEP 在泛化到未见任务的能力上优于当前的 SoTA 预训练方法。VEP 在奖励上实现了高达 2×2\times 的提升,在样本效率上实现了高达 3×3\times 的提升。有关 VEP 策略的视频,请访问我们的网站。

关键词

引用

@article{arxiv.2312.12339,
  title  = {Value Explicit Pretraining for Learning Transferable Representations},
  author = {Kiran Lekkala and Henghui Bao and Sumedh A. Sontakke and Erdem Biyik and Laurent Itti},
  journal= {arXiv preprint arXiv:2312.12339},
  year   = {2026}
}

备注

Published in Robotics and Automation Letters (RA-L), January 2026