中文

面向多视图工程图的基于视觉语言模型的自动解释多阶段混合框架

计算机视觉与模式识别 2026-01-26 v2 人工智能 信息检索

摘要

工程图是制造业沟通的基本媒介,作为传递设计意图、公差和生产细节的主要载体。然而,使用手动方法、通用光学字符识别(OCR)系统或传统深度学习方法来解释具有密集注释的复杂多视图图仍具有挑战,因为其布局、方向和混合符号文本内容各不相同。为此,本文提出了一种用于自动解释二维多视图工程图的三阶段混合框架,采用现代检测和视觉语言模型(VLM)。第一阶段使用YOLOv11-det执行布局分割,以局部分析关键区域,如视图、标题块和注释。第二阶段使用YOLOv11-obb进行方向感知的、精细的注释检测,包括尺寸、GD&T符号和表面粗糙度指示。第三阶段采用两个基于Donut的OCR-free VLM进行语义内容解析:Alphabetical VLM从标题块和注释中提取文本和类别信息,而Numerical VLM解释量化数据,如尺寸、GD&T框架和表面粗糙度。开发了两个专门的数据集以确保鲁棒性和泛化性:1000幅图用于布局检测,1406幅图用于注释级别训练。Alphabetical VLM实现了0.672的总体F1分数,Numerical VLM达到0.963,分别在文本和量化解释方面表现突出。统一的JSON输出使其能够无缝集成到CAD和制造数据库中,为智能工程图分析提供了可扩展解决方案。

关键词

引用

@article{arxiv.2510.21862,
  title  = {A Multi-Stage Hybrid Framework for Automated Interpretation of Multi-View Engineering Drawings Using Vision Language Model},
  author = {Muhammad Tayyab Khan and Zane Yong and Lequn Chen and Wenhe Feng and Nicholas Yew Jin Tan and Seung Ki Moon},
  journal= {arXiv preprint arXiv:2510.21862},
  year   = {2026}
}

备注

This draft has been accepted in the 13th International Conference on Industrial Engineering and Applications (ICIEA 2026)