用于视觉运动策略的预言机引导掩码对比强化学习
机器人学
2025-10-08 v1 机器学习
摘要
学习视觉运动策略的一种主流方法是采用强化学习将高维视觉观测直接映射到动作指令。然而,高维视觉输入与敏捷机动输出的结合带来了长期存在的挑战,包括样本效率低和显著的 sim-to-real 差距。为了解决这些问题,我们提出了预言机引导掩码对比强化学习(OMC-RL),这是一种旨在提高视觉运动策略学习样本效率和渐近性能的新框架。OMC-RL 明确将学习过程解耦为两个阶段:上游表示学习阶段和下游策略学习阶段。在上游阶段,使用时间建模和对比学习训练掩码 Transformer 模块,以从序列视觉输入中提取具有时间感知且与任务相关的表示。训练完成后,学习到的编码器被冻结并用于从连续帧中提取视觉表示,同时丢弃 Transformer 模块。在下游阶段,一个能够特权访问全局状态信息的预言机教师策略在训练早期监督智能体,以提供有益的指导并加速早期策略学习。随着训练的进行,这种指导逐渐减少,以允许独立的探索。在模拟和真实环境中的大量实验表明,OMC-RL 实现了卓越的样本效率和渐近策略性能,同时提高了在多样且感知复杂的场景中的泛化能力。
引用
@article{arxiv.2510.05692,
title = {Oracle-Guided Masked Contrastive Reinforcement Learning for Visuomotor Policies},
author = {Yuhang Zhang and Jiaping Xiao and Chao Yan and Mir Feroskhan},
journal= {arXiv preprint arXiv:2510.05692},
year = {2025}
}