从草图到决策:解析二维工程图为结构化制造知识的混合视觉语言框架
计算机视觉与模式识别
2025-09-30 v2 人工智能
信息检索
摘要
高效准确地从二维工程图中提取关键信息是推进数字制造工作流程的关键。此类信息包括几何尺寸容许控制 (GD&T)、尺寸、材料规格及文字注释。手动提取方法缓慢且费力,通用 OCR 模型常因复杂布局、工程符号和旋转文本而难以处理,导致提取结果不完整且不可靠。为此,我们提出一种混合视觉语言框架,集成旋转感知目标检测模型(YOLOv11-obb)与基于 Transformer 的视觉语言解析器。该结构化管道首先应用 YOLOv11-OBB 对注释进行定位,提取倾斜边界框 (OBB) 区域,再通过微调的轻量级视觉语言模型(VLM)对其进行结构化解析。我们构建了一个包含 1,367 幅二维机械图纸、覆盖九个关键类别的标注数据集。YOLOv11-OBB 在该数据集上训练,用于检测 OBB 并提取注释区域。随后利用两个开源视觉语言模型:Donut 与 Florence-2,对这些区域进行结构化解析。两种模型均为轻量级,适用于计算资源受限的专业工业任务。对两种模型在构建好的带结构标注标签的图像块数据集上进行微调后,开展了基于四个关键指标的性能对比实验。Donut 的性能优于 Florence-2,分别达到 88.5% 的精确率、99.2% 的召回率和 93.5% 的 F1 分数,幻觉率为 11.5%。最后通过案例研究表明,提取的结构化信息可支持后续制造任务,如工艺与工具选择,展示了该框架在现代化二维图纸解释中的实际价值。
关键词
引用
@article{arxiv.2506.17374,
title = {From Drawings to Decisions: A Hybrid Vision-Language Framework for Parsing 2D Engineering Drawings into Structured Manufacturing Knowledge},
author = {Muhammad Tayyab Khan and Lequn Chen and Zane Yong and Jun Ming Tan and Wenhe Feng and Seung Ki Moon},
journal= {arXiv preprint arXiv:2506.17374},
year = {2025}
}
备注
Preprint submitted to Elsevier