从代码到行动:Diffusion-VLM 策略的分层学习
机器人学
2025-09-30 v1 机器学习
摘要
用于机器人操作的模仿学习通常面临泛化能力有限和数据稀缺的问题,在复杂的长时程任务中尤为如此。在本研究中,我们引入了一个分层框架,该框架结合了生成代码的视觉语言模型(VLM)与低层扩散策略,以有效地模仿和泛化机器人行为。我们的核心见解是将开源机器人 API 不仅视为执行接口,还视为结构化监督的来源:相关联的子任务函数——一旦暴露——可以作为模块化且具有语义意义的标签。我们训练 VLM 将任务描述分解为可执行的子程序,随后通过训练用于模仿相应机器人行为的扩散策略来落地这些子程序。为了处理代码执行和某些现实世界任务(例如物体交换)的非马尔可夫性质,我们的架构引入了一种记忆机制,用于在时间维度上维护子任务上下文。我们发现,这种设计实现了可解释的策略分解,与扁平策略相比提高了泛化能力,并能够对高层规划与低层控制进行独立评估。
引用
@article{arxiv.2509.24917,
title = {From Code to Action: Hierarchical Learning of Diffusion-VLM Policies},
author = {Markus Peschl and Pietro Mazzaglia and Daniel Dijkman},
journal= {arXiv preprint arXiv:2509.24917},
year = {2025}
}
备注
19 pages including references, 6 figures. Accepted to CoRL LEAP 2025