重新审视 VerilogEval:大型语言模型在硬件代码生成领域的一年进展
摘要
将大型语言模型(LLM)应用于数字硬件代码生成是一个新兴领域,而大多数 LLM 主要在自然语言和软件代码上进行训练。像 Verilog 这样的硬件代码在训练数据中只占很小一部分,且现有的硬件基准测试很少。2023年11月发布的开源 VerilogEval 基准测试为 LLM 在代码补全任务上提供了一致的评估框架。自那时起,商业模型和开源模型都取得了显著发展。在这项工作中,我们使用改进后的 VerilogEval 基准测试套件,对自 VerilogEval 最初发布以来的新商业和开源模型进行了评估,包括 GPT-4o、GPT-4 Turbo、Llama3.1 (8B/70B/405B)、Llama3 70B、Mistral Large、DeepSeek Coder (33B 和 6.7B)、CodeGemma 7B 以及 RTL-Coder。我们发现最先进的模型取得了可衡量的改进:GPT-4o 在规范到 RTL 任务上达到了 63% 的通过率。最近发布的开源 Llama3.1 405B 达到了 58% 的通过率,几乎与 GPT-4o 持平,而较小的特定领域 RTL-Coder 6.7B 模型也达到了令人瞩目的 34% 的通过率。此外,我们通过自动分类失败原因、引入上下文学习支持以及将任务扩展到规范到 RTL 转换,增强了 VerilogEval 的基础设施。我们发现,提示工程对于获得良好的通过率仍然至关重要,并且因模型和任务而异。一个允许进行提示工程和失败分析的基准测试基础设施对于模型的持续开发和部署是必不可少的。
引用
@article{arxiv.2408.11053,
title = {Revisiting VerilogEval: A Year of Improvements in Large-Language Models for Hardware Code Generation},
author = {Nathaniel Pinckney and Christopher Batten and Mingjie Liu and Haoxing Ren and Brucek Khailany},
journal= {arXiv preprint arXiv:2408.11053},
year = {2025}
}
备注
This paper revisits and improves the benchmark first presented in arXiv:2309.07544. Twenty-one pages, five figures