微调视觉语言模型用于自动化工程图纸信息提取
计算机视觉与模式识别
2024-11-07 v1 人工智能
摘要
几何尺寸与公差(GD&T)在制造业中通过定义零件特征的可接受偏差来确保组件质量和功能性,发挥着关键作用。然而,从二维工程图纸中提取 GD&T 信息是一项耗时且劳动密集型的任务,通常依赖人工或半自动化工具。为应对这些挑战,本研究提出了一种通过微调 Florence-2(一种开源视觉语言模型 VLM)来实现自动化且计算高效的 GD&T 提取方法。该模型在由领域专家提供真实标注的 400 张图纸数据集上进行训练。为进行比较,两种最先进的闭源 VLM(GPT-4o 和 Claude-3.5-Sonnet)在相同数据集上进行评估。所有模型均使用精确率、召回率、F1 分数和幻觉率指标进行评估。由于微调大型闭源 VLM 进行领域特定任务的计算成本和不切实际性,GPT-4o 和 Claude-3.5-Sonnet 在零样本设置下进行评估。相比之下,参数仅为 0.23 亿的较小模型 Florence-2 通过全参数微调在三个不同实验中进行了优化,每个实验使用了不同程度增强的数据集。结果表明,与表现最佳的闭源模型相比,Florence-2 在精确率上提高了 29.95%,召回率提高了 37.75%,F1 分数提高了 52.40%,幻觉率降低了 43.15%。这些发现凸显了微调较小开源 VLM(如 Florence-2)的有效性,为自动化 GD&T 提取提供了一种实用且高效的解决方案,以支持下游制造任务。
引用
@article{arxiv.2411.03707,
title = {Fine-Tuning Vision-Language Model for Automated Engineering Drawing Information Extraction},
author = {Muhammad Tayyab Khan and Lequn Chen and Ye Han Ng and Wenhe Feng and Nicholas Yew Jin Tan and Seung Ki Moon},
journal= {arXiv preprint arXiv:2411.03707},
year = {2024}
}
备注
Paper has been submitted to the 9th International Conference on Innovation in Artificial Intelligence (ICIAI 2025)