中文

LEGO Co-builder: 探索面向多模态乐高组装助手的细粒度视觉语言建模

人工智能 2025-07-24 v2 计算与语言 计算机视觉与模式识别

摘要

视觉语言模型(VLM)在理解和遵循多模态组装指令方面正面临挑战,尤其是在需要细粒度空间推理和精确物体状态检测时。在这项工作中,我们探索了LEGO Co-builder,这是一个结合了真实世界乐高组装逻辑与程序化生成的多模态场景的混合基准测试。该数据集捕获了逐步的视觉状态和程序化指令,允许对指令遵循、物体检测和状态检测进行受控评估。我们引入了一个统一框架,并在零样本和微调设置下评估了领先的VLM,如GPT-4o、Gemini和Qwen-VL。我们的结果表明,即使是像GPT-4o这样的先进模型,在细粒度组装任务上也表现挣扎,在状态检测上的最大F1分数仅为40.54%,凸显了细粒度视觉理解方面的差距。我们发布了该基准测试、代码库和生成流程,以支持未来基于真实世界工作流程的多模态组装助手研究。

关键词

引用

@article{arxiv.2507.05515,
  title  = {LEGO Co-builder: Exploring Fine-Grained Vision-Language Modeling for Multimodal LEGO Assembly Assistants},
  author = {Haochen Huang and Jiahuan Pei and Mohammad Aliannejadi and Xin Sun and Moonisa Ahsan and Chuang Yu and Zhaochun Ren and Pablo Cesar and Junxiao Wang},
  journal= {arXiv preprint arXiv:2507.05515},
  year   = {2025}
}

备注

This version has been anonymized for double-blind review