中文

通过视觉-语言模型在三维 CAD 装配体中实现错误笔记本引导的免训练零件检索

人工智能 2026-02-26 v3

摘要

在复杂的 CAD 装配体中,有效的规格感知零件检索对于自动化工程任务至关重要。然而,使用大语言模型/视觉-语言模型来完成此任务具有挑战性:CAD 模型元数据序列常常超出令牌预算,并且无法对高性能的专有模型(例如 GPT 或 Gemini)进行微调。因此,我们需要一个框架,能够通过使用视觉-语言模型处理冗长的、非自然语言的 CAD 模型元数据来提供工程价值,但无需训练。我们提出一个具有推理时自适应的两阶段框架,该框架将修正后的错误笔记本与检索增强生成相结合,以显著改善基于视觉-语言模型的零件检索推理。每个错误笔记本都是通过反思性精炼修正初始思维链,然后使用我们提出的语法约束验证器过滤每个轨迹以确保结构良好性而构建的。由此产生的笔记本形成了一个高质量的规格-思维链-答案三元组仓库,检索增强生成从中检索与规格相关的范例,以条件化模型的推理。我们还贡献了一个带有人类偏好标注的 CAD 数据集。使用专有模型(GPT-4o、Gemini 等)的实验显示出巨大增益,其中 GPT-4o (Omni) 在人类偏好基准上实现了高达 +23.4 的绝对准确率点数提升。所提出的语法约束验证器可以进一步带来高达 +4.5 的准确率点数提升。我们的方法也超越了其他免训练基线(标准少样本学习、自一致性),并为开源视觉-语言模型(Qwen2-VL-2B-Instruct、Aya-Vision-8B)带来了显著改进。在跨模型语法约束设置下,即使用 GPT-4o (Omni) 构建错误笔记本时,2B 模型的推理性能达到了与 GPT-4o mini 相差约 4 个点以内的水平。

关键词

引用

@article{arxiv.2509.01350,
  title  = {Error Notebook-Guided, Training-Free Part Retrieval in 3D CAD Assemblies via Vision-Language Models},
  author = {Yunqing Liu and Nan Zhang and Zhiming Tan},
  journal= {arXiv preprint arXiv:2509.01350},
  year   = {2026}
}

备注

Accepted by ICLR 2026