中文

从幻象到落地:迈向可靠的多模态电路图到 Verilog 代码生成

软件工程 2026-05-06 v2 人工智能

摘要

多模态大语言模型(MLLM)越来越多地被用于将视觉产物转换为代码,从 UI 模型到 HTML,再到科学图表到 Python 脚本。电路图可被视为一种用于硬件的视觉领域特定语言:它编码了时序、拓扑和位级语义,这些在随意检查时不可见,但一旦在硅片上制造出来就至关重要。因此,将此类图表转换为寄存器传输级(RTL)代码是对视觉到代码生成的一次极端可靠性测试。我们揭示了一种我们称之为“幻象”的现象:用空白图像替换电路图后,Pass@k 保持不变甚至更高,因为模型绕过了视觉输入,转而利用模块头中的标识符语义来检索规范的 RTL 模板。这构成了人工智能辅助代码生成中一种新型、高度隐蔽的缺陷类别,直接损害了多模态大语言模型的可信度。为了量化这种效应,我们构建了 C2VEVAL,并在配对的 Normal/Anony 协议下评估了八个多模态大语言模型,其中 Anony 模式会匿名化图表和模块头中的所有标识符;所有模型在 Anony 模式下的得分都急剧下降,证实了高 Normal 模式准确率在很大程度上是一种幻象。然后,我们提出了 VeriGround(4B),它通过标识符匿名化、拒绝增强和 D-ORPO(决策聚焦 ORPO)偏好对齐进行训练,该对齐方法提高了关键的“生成或拒绝”令牌的权重。VeriGround 在 Normal/Anony 模式下实现了 46.11%/42.51% 的 Functional Pass@1,而错误拒绝率仅为 1.20%/0.00%,同时在空白图像上保持了 >92% 的拒绝率。仅凭 4B 参数,VeriGround 在 Normal 模式下与 GPT-5.4 性能相当,并在 Anony 模式下显著优于所有基线,证实了其真正的视觉落地能力。

关键词

引用

@article{arxiv.2604.27969,
  title  = {From Mirage to Grounding: Towards Reliable Multimodal Circuit-to-Verilog Code Generation},
  author = {Guang Yang and Xing Hu and Xiang Chen and Xin Xia},
  journal= {arXiv preprint arXiv:2604.27969},
  year   = {2026}
}