中文

文本增强的 CAD 图纸全景符号检测

计算机视觉与模式识别 2025-10-14 v1 人工智能

摘要

随着计算机辅助设计 (CAD) 图纸在工程、建筑和工业设计中的广泛应用,准确解释和分析这些图纸的能力日益关键。 在各种子任务中,全景符号检测在实现 CAD 自动化和设计检索等下游应用方面发挥着关键作用。现有方法主要关注 CAD 图纸中的几何原语,以解决此任务,但面临两个主要问题:它们通常忽略 CAD 图纸中丰富的文本注释,并且缺乏对原语之间关系的显式建模,导致对整体图纸的理解不完整。为填补这一空白,我们提出了一个包含文本注释的全景符号检测框架。该框架通过联合建模几何和文本原语来构建统一的表示。随后,利用预训练 CNN 提取的视觉特征作为初始表示,采用增强类型感知注意力机制以显式建模各种原语之间不同类型的空间依赖性的 Transformer 架构。在真实世界数据集上的大量实验表明,所提方法在涉及文本注释的符号检测任务中优于现有方法,并在应用于复杂 CAD 图纸时表现出优异的鲁棒性。

关键词

引用

@article{arxiv.2510.11091,
  title  = {Text-Enhanced Panoptic Symbol Spotting in CAD Drawings},
  author = {Xianlin Liu and Yan Gong and Bohao Li and Jiajing Huang and Bowen Du and Junchen Ye and Liyan Xu},
  journal= {arXiv preprint arXiv:2510.11091},
  year   = {2025}
}

备注

7 pages, 3figures. This version is the original submitted manuscript of the paper accepted by The 12th International Conference on Behavioural and Social Computing