中文

CrochetBench:视觉语言模型能否从描述走向行动——以编织为例

人工智能 2026-02-04 v2

摘要

虽然多模态大语言模型能够描述视觉内容,但其生成可执行程序的能力仍未得到充分探索。本文提出的 CrochetBench 通过细粒度的编织程序推理来评估这一从描述到行动的转变:模型必须识别针织图案、选择结构上恰当的指令,并生成可编译的程序。我们采用 CrochetPARADE DSL 作为中间表示,实现结构验证和功能评估。基准测试涵盖针织图案分类、指令定位以及自然语言与图像到 DSL 翻译等任务。在所有任务中,随着评估从表面层相似性转向可执行正确性,性能显著下降,这揭示了长程符号推理和三维感知程序综合的局限性。我们提出的 CrochetBench 为评估多模态模型的程序能力提供了新视角,凸显了在现实创意领域中,表层理解与可执行精度之间的鸿沟。代码已公开于 https://anonymous.4open.science/r/crochet-82E6/README.md。

关键词

引用

@article{arxiv.2511.09483,
  title  = {CrochetBench: Can Vision-Language Models Move from Describing to Doing in Crochet Domain?},
  author = {Peiyu Li and Xiaobao Huang and Ting Hua and Nitesh V. Chawla},
  journal= {arXiv preprint arXiv:2511.09483},
  year   = {2026}
}

备注

code available at https://github.com/Peiyu-Georgia-Li/crochetBench