VeriLeaky:在 LLM 驱动的 Verilog 编码微调中权衡 IP 保护与实用性
密码学与安全
2025-06-19 v4 硬件体系结构
机器学习
摘要
大型语言模型(LLMs)为编码提供了巨大潜力,然而对于 Verilog 等小众语言,使用精选数据进行微调(FT)是必不可少的。使用专有知识产权(IP)进行 FT 带来了严重的风险,因为 FT 数据可能会通过 LLM 推理泄露。这给设计公司带来了一个关键的困境:在寻求构建提供具有竞争力的 Verilog 编码能力的外部可访问 LLM 时,他们如何利用内部 IP 来增强 FT 实用性,同时确保 IP 保护?我们在文献中首次研究了这一困境。使用 LLaMA 3.1-8B,我们在基线 Verilog 数据集(RTLCoder)上进行了内部 FT,并补充了我们自己的内部 IP,该 IP 已通过多次流片验证。为了严格评估 IP 泄露,我们量化了生成代码与我们的内部 IP 之间的结构相似性(AST/Dolos)和功能等价性(Synopsys Formality)。我们表明我们的 IP 确实可能被泄露,证实了这一威胁。作为防御,我们评估了 Verilog 代码的逻辑锁定(ASSURE)。这提供了一定程度的保护,但降低了 IP 对 FT 的实用性,并使 LLM 的性能下降。我们的研究表明,需要既有效又对 FT 破坏最小的新策略,这是使设计公司能够充分利用其专有 IP 进行 LLM 驱动的 Verilog 编码的关键努力。
引用
@article{arxiv.2503.13116,
title = {VeriLeaky: Navigating IP Protection vs Utility in Fine-Tuning for LLM-Driven Verilog Coding},
author = {Zeng Wang and Minghao Shao and Mohammed Nabeel and Prithwish Basu Roy and Likhitha Mankali and Jitendra Bhandari and Ramesh Karri and Ozgur Sinanoglu and Muhammad Shafique and Johann Knechtel},
journal= {arXiv preprint arXiv:2503.13116},
year = {2025}
}