中文

面向 RTL 生成的合成循环评估:质量、可靠性与失效模式

硬件体系结构 2026-05-12 v2 软件工程

摘要

RTL 生成远不止代码合成。设计必须满足语法正确、可综合、功能正确且硬件高效等要求。现有 SOTA 评估仅关注功能正确性,未衡量综合与实现质量。本文在 VerilogEval 和 RTLLM 数据集上评估 32 个语言模型,采用结合后综合面积、延迟及与专家参考相关的警告信息的硬件质量指数(HQI)进行 Nangate45 45nm 流程下的评估。发现三种性能 regime:14 个前沿模型实现 HQI > 66,由 Gemini-3-Pro 以 87.5% 覆盖率和 85.1 HQI 领先;15 个模型聚集在 43-66 之间;3 个模型低于 43。最佳五模组能力与单次尝试质量之间的差距跨越 3.7-22.1 HQI 分点,限制了其在智能体管道中的集成。我们通过分析 195 种综合失效,揭示系统性差异:专有模型在 elaboration 错误和综合超时后失败;开源模型常因缺失模块包装器和不可综合 construct 而早期失效,这一模式与训练语料库偏向仿真而非综合级 RTL 的倾向相吻合。

关键词

引用

@article{arxiv.2603.11287,
  title  = {Synthesis-in-the-Loop Evaluation of LLMs for RTL Generation: Quality, Reliability, and Failure Modes},
  author = {Weimin Fu and Zeng Wang and Minghao Shao and Ramesh Karri and Muhammad Shafique and Johann Knechtel and Ozgur Sinanoglu and Xiaolong Guo},
  journal= {arXiv preprint arXiv:2603.11287},
  year   = {2026}
}

备注

8 pages, 8 figures