中文

RMTL:基于VLM奖励的强化微任务学习用于长程机械操作

机器人学 2026-06-24 v1

摘要

用于机械操作的强化学习(RL)常需人工设计稠密奖励函数,这类函数难以调参且往往脆弱;或从人类示范或偏好中学习奖励,这可能代价高昂。近期一系列工作使用预训练视觉-语言模型(VLMs)作为零样本奖励模型,以单一文本提示替代上述成本。然而,我们认为单一全局提示对于具有随机初始条件的长程操作任务过于粗糙。单提示VLM奖励在轨迹大部分时段近乎平坦,使智能体难以察觉早期进展。我们提出强化微任务学习(RMTL),该方法将操作任务分解为一组语言描述的微任务,并训练智能体在它们之间切换。每一步,智能体接收使用当前活跃微任务提示计算、并在多相机视角上平均以减少视角相关遮挡影响的多视角VLM奖励。反向课程逐步使智能体接触更难的初始条件,而PPO工作器首先以固定的基于距离的规则训练,该规则选择活跃微任务。随后我们将此规则替换为习得的分层管理器,将基于规则的阶段选择转变为完全习得的分层策略。我们在Fetch操作环境上实例化RMTL,使用三个简短的阶段特定提示且无需额外提示调优。实验显示,RMTL比单提示VLM奖励提供更丰富的奖励信号,从而实现更快的学习。这些结果表明,将VLM奖励分解为微任务特定语言提示可显著提升语言引导强化学习在机器人操作中的可扩展性。

关键词

引用

@article{arxiv.2606.26175,
  title  = {RMTL: Reinforced Micro-task Learning for Long-Horizon Manipulation with VLM Rewards},
  author = {Anıl Can Ateş and Orhan Kahraman and Cihan Topal},
  journal= {arXiv preprint arXiv:2606.26175},
  year   = {2026}
}

备注

16 pages, 11 figures