自由与公平的硬件:使用LLM生成无版权侵权的Verilog代码的途径
人工智能
2025-07-02 v2
摘要
大型语言模型 (LLM) 在硬件设计任务(如生成功能性 Verilog 代码)上的能力限制,促使了利用来自开源仓库的精选硬件数据集进行各种微调优化。然而,这些数据集规模仍然有限,并且对重复使用的许可检查极少,导致微调后的 LLM 存在潜在的版权侵权问题。因此,我们提出了一个评估基准,用于估计经过 Verilog 训练的 LLM 生成受版权保护代码的风险。为了最小化这种风险,我们提供了一个开源的 Verilog 数据集 FreeSet,包含超过 22 万个文件,以及用于提供公平使用 Verilog 数据额外保证的自动化数据集管理框架。然后,我们执行了一个包含持续预训练的 LLM 微调框架,得到了一个针对 Verilog 微调的 Llama 模型 FreeV。我们的结果表明,FreeV 在先前的工作中表现出最小的版权侵权风险,违规率仅为 3%。此外,实验结果证明了其在 Verilog 生成功能上相对于基线模型的改进,将 VerilogEval pass@10 率提高了超过 10%。
引用
@article{arxiv.2505.06096,
title = {Free and Fair Hardware: A Pathway to Copyright Infringement-Free Verilog Generation using LLMs},
author = {Sam Bush and Matthew DeLorenzo and Phat Tieu and Jeyavijayan Rajendran},
journal= {arXiv preprint arXiv:2505.06096},
year = {2025}
}
备注
Accepted at DAC 2025