中文

桥接思考与行动:基于通用动作专家释放视觉语言模型的物理潜能

计算机视觉与模式识别 2025-10-07 v1 机器人学

摘要

虽然视觉语言模型 (VLM) 已展示出惊人的规划和推理能力,但将这些能力转化到物理世界则面临重大挑战。传统的视觉语言动作 (VLA) 模型将推理与动作集成到单一架构中,泛化能力差,因为受限于稀缺、狭域数据。虽然最近的双系统方法试图将“思考”与“行动”解耦,但常受制于动作模块中的语义歧义。这种歧义使得大规模、跨任务训练难以实现。因此,这些系统通常在部署到新环境时需要针对新收集的数据进行微调,而两种系统之间的协作机制仍不明确。为解决这些限制,我们首次引入一个以通用动作专家为中心的框架。我们的方法利用稀疏 3D 轨迹作为中间表示,有效桥接 VLM 的高级规划能力与低级物理动作模块。 在规划阶段,仅需要求 VLM 生成粗糙的 3D 路标点。这些路标点随后由我们的通用动作专家处理,通过对环境实时点云观察进行采样,将其细化为密集的、可执行的动作序列。为促进训练效率和稳健的泛化,我们引入一种新的“动作预训练、点云微调”范式。该方法将 VLM 在视觉理解和规划方面的广泛泛化能力与动作专家在细粒度、动作层面的泛化能力相结合。

关键词

引用

@article{arxiv.2510.03896,
  title  = {Bridge Thinking and Acting: Unleashing Physical Potential of VLM with Generalizable Action Expert},
  author = {Mingyu Liu and Zheng Huang and Xiaoyi Lin and Muzhi Zhu and Canyu Zhao and Zongze Du and Yating Wang and Haoyi Zhu and Hao Chen and Chunhua Shen},
  journal= {arXiv preprint arXiv:2510.03896},
  year   = {2025}
}