CadVLM:在参数化CAD草图生成中桥接语言与视觉
计算机视觉与模式识别
2024-09-27 v1 人工智能
摘要
参数化计算机辅助设计(Computer-Aided Design, CAD)是当代机械设计的核心。然而,它在实现精确的参数化草图建模方面遇到挑战,并且缺乏适用于机械设计的实用评估指标。我们利用预训练基础模型的能力(这些模型在自然语言处理和计算机视觉领域取得了成功),开发了专门用于CAD的生成模型。这些模型擅长理解复杂的几何形状和设计推理,这是CAD技术的关键进步。在本文中,我们提出了CadVLM,一个用于CAD生成的端到端视觉语言模型。我们的方法涉及调整预训练基础模型以有效操作工程草图,同时整合草图基元序列和草图图像。大量实验表明,在多个CAD草图生成任务(如CAD自动补全、CAD自动约束和图像条件生成)上,其性能优越。据我们所知,这是多模态大语言模型(Large Language Model, LLM)首次成功应用于参数化CAD生成,代表了计算机辅助机械设计领域的开创性一步。
引用
@article{arxiv.2409.17457,
title = {CadVLM: Bridging Language and Vision in the Generation of Parametric CAD Sketches},
author = {Sifan Wu and Amir Khasahmadi and Mor Katz and Pradeep Kumar Jayaraman and Yewen Pu and Karl Willis and Bang Liu},
journal= {arXiv preprint arXiv:2409.17457},
year = {2024}
}