中文

CodeDiffuser:基于 VLM 生成代码的注意力增强扩散策略用于指令歧义处理

机器人学 2025-06-23 v1 计算机视觉与模式识别 机器学习 软件工程

摘要

自然语言指令用于机器人操作任务时常存在歧义与模糊性。例如,“将杯子挂在杯树上”这一指令若存在多个杯子和分枝,可能涉及多种有效操作。现有的语言条件策略通常依赖端到端模型同时处理高层语义理解和低层动作生成,由于缺乏模块性和可解释性,可能导致性能次优。为此,我们引入一种新型机器人操作框架,可完成由可能存在歧义的自然语言指定的任务。该框架采用视觉语言模型(VLM)来解释自然语言指令中的抽象概念,并生成特定于任务的代码——一种可解释且可执行的中间表示。生成的代码与感知模块接口,产生突出任务相关区域的 3D 注意力图,通过整合空间信息和语义信息有效解决指令中的歧义。通过大量实验,我们识别了当前模仿学习方法的关键局限性,如对语言和环境变化的适应性差。我们表明,该方法在涉及语言歧义、接触丰富的操控以及多对象交互的挑战性操作任务中表现出色。

关键词

引用

@article{arxiv.2506.16652,
  title  = {CodeDiffuser: Attention-Enhanced Diffusion Policy via VLM-Generated Code for Instruction Ambiguity},
  author = {Guang Yin and Yitong Li and Yixuan Wang and Dale McConachie and Paarth Shah and Kunimatsu Hashimoto and Huan Zhang and Katherine Liu and Yunzhu Li},
  journal= {arXiv preprint arXiv:2506.16652},
  year   = {2025}
}

备注

Accepted to Robotics: Science and Systems (RSS) 2025. The first three authors contributed equally. Project Page: https://robopil.github.io/code-diffuser/