中文

面向视觉强化学习的 Semore:VLM 引导的增强语义运动表征

计算机视觉与模式识别 2025-12-08 v1 人工智能

摘要

大型语言模型(LLM)和视觉语言模型(VLM)的不断发展,为增强强化学习(RL)的有效性开辟了新的途径。然而,现有的基于 LLM 的 RL 方法通常侧重于控制策略的引导,面临背后网络表示受限的挑战。为此,我们引入 Enhanced Semantic Motion Representations(Semore),一个新的基于 VLM 的视觉 RL 框架,能够通过从 RGB 流中提取的双路径主干网络同时提取语义和运动表征。Semore 利用具备常识知识的 VLM 从观察中检索关键信息,同时使用预训练的 CLIP 实现文本-图像对齐,从而将 ground-truth 表征嵌入主干网络中。为高效融合语义和运动表征以进行决策,我们的方法采用独立监督方法,同时指导语义和运动的提取,同时允许它们自发相互作用。大量实验表明,在 VLM 进行特征层面引导下,我们的方法展现出比现有先进方法更高效和更具适应性的能力。所有代码已公开。

关键词

引用

@article{arxiv.2512.05172,
  title  = {Semore: VLM-guided Enhanced Semantic Motion Representations for Visual Reinforcement Learning},
  author = {Wentao Wang and Chunyang Liu and Kehua Sheng and Bo Zhang and Yan Wang},
  journal= {arXiv preprint arXiv:2512.05172},
  year   = {2025}
}