中文

超越像素:面向可靠原理图审计的向量到图转换

人工智能 2026-02-13 v1 计算机视觉与模式识别

摘要

多模态大语言模型 (MLLM) 在视觉理解方面取得了显著进展,但仍存在一个关键局限:对结构的盲区。即便是最先进的模型也无法捕获工程原理图中的拓扑结构和符号逻辑,因为其基于像素的范式丢弃了对推理所必需的显式向量定义关系。为此,我们提出一种向量到图 (Vector-to-Graph, V2G) 流水线,将 CAD 图示转换为具有属性的图,其中节点代表组件,边编码连通性,从而使结构依赖关系显式且可审计。实验表明,在电气合规性检查的诊断基准上,V2G 在所有错误类别上均实现了显著的准确率提升,而领先的 MLLM 仍保持接近随机水平的表现。这些结果凸显了基于像素的方法的系统性不足,证明结构感知表征为将多模态 AI 在工程领域实现实际部署提供了可靠路径。为促进进一步的研究,我们将公开基准数据集和实现代码于 https://github.com/gm-embodied/V2G-Audit。

关键词

引用

@article{arxiv.2602.11678,
  title  = {Beyond Pixels: Vector-to-Graph Transformation for Reliable Schematic Auditing},
  author = {Chengwei Ma and Zhen Tian and Zhou Zhou and Zhixian Xu and Xiaowei Zhu and Xia Hua and Si Shi and F. Richard Yu},
  journal= {arXiv preprint arXiv:2602.11678},
  year   = {2026}
}

备注

4 pages, 3 figures. Accepted to ICASSP 2026