中文

点还是线?基于线表示的 CAD 图纸全景符号识别

计算机视觉与模式识别 2025-10-20 v3

摘要

我们研究了全景符号识别任务,该任务涉及在由矢量图元组成的计算机辅助设计(CAD)图纸中,识别可数事物的单个实例以及不可数物质的语义区域。现有方法通常依赖于图像栅格化、图构建或基于点的表示,但这些方法往往存在计算成本高、泛化性有限以及丢失几何结构信息的问题。在本文中,我们提出了 VecFormer,一种通过基于线的图元表示来解决这些挑战的新方法。这种设计保留了原始图元的几何连续性,能够实现更准确的形状表示,同时保持对计算友好的结构,使其非常适合矢量图形理解任务。为了进一步提高预测的可靠性,我们引入了分支融合细化模块,该模块有效地整合了实例预测和语义预测,解决了它们之间的不一致性,从而产生更连贯的全景输出。大量实验表明,我们的方法建立了新的 SOTA,实现了 91.1 PQ,在有无先验信息的设置下,Stuff-PQ 分别比第二优结果提高了 9.6 和 21.2 个点,突显了基于线的表示作为矢量图形理解基础的强大潜力。

关键词

引用

@article{arxiv.2505.23395,
  title  = {Point or Line? Using Line-based Representation for Panoptic Symbol Spotting in CAD Drawings},
  author = {Xingguang Wei and Haomin Wang and Shenglong Ye and Ruifeng Luo and Yanting Zhang and Lixin Gu and Jifeng Dai and Yu Qiao and Wenhai Wang and Hongjie Zhang},
  journal= {arXiv preprint arXiv:2505.23395},
  year   = {2025}
}