我们真的能学习一种表示来优化所有奖励吗?
机器学习
2026-02-13 v1 人工智能
机器人学
摘要
随着机器学习转向利用大型模型作为下游任务的先验,学术界一直在争论解决强化学习问题的合适先验形式。如果试图预取尽可能多的计算,人们会尝试为某个尚未确定的奖励函数学习策略的先验。最近的工作(前向-后向表示学习)尝试了这一点,认为无监督表示学习过程可以在无需进一步微调的情况下实现对任意奖励的最优控制。然而,FB的训练目标和学习行为仍然神秘。在本文中,我们通过阐明此类表示何时存在、其目标优化什么以及它在实践中如何收敛,来揭开FB的神秘面纱。我们将其与秩匹配、拟合Q评估和压缩映射建立联系。我们的分析提出了一种简化的无监督强化学习预训练方法,该方法并非实现最优控制,而是执行一步策略改进。我们将提出的方法称为。在教学环境以及个基于状态和基于图像的连续控制领域中的实验表明,one-step FB收敛到的误差小倍,并将零样本性能平均提高了。我们的项目网站可在https://chongyi-zheng.github.io/onestep-fb访问。
引用
@article{arxiv.2602.11399,
title = {Can We Really Learn One Representation to Optimize All Rewards?},
author = {Chongyi Zheng and Royina Karegoudra Jayanth and Benjamin Eysenbach},
journal= {arXiv preprint arXiv:2602.11399},
year = {2026}
}