SafeTune:缓解LLM微调中数据投毒——面向RTL代码生成
等离子体物理
2026-05-01 v1
摘要
随着大型语言模型(LLM)越来越多地被微调用于硬件任务,如RTL代码生成,稀缺的高质量数据集常导致使用快速组装或生成的训练数据。这些数据集经常缺乏安全验证,高度易受数据投毒攻击。此类投毒可导致模型生成在语法上有效但不安全的硬件模块,绕过标准功能检查。为此,我们提出SafeTune框架,以增强针对RTL生成的LLM抗投毒能力,特别关注硬件Trojan(HT)插入。SafeTune集成了两个核心组件:(i)用于在微调期间识别异常电路模式的图神经网络(GNN),以及(ii)使用文本嵌入和XGBoost分类器评估提示安全性的语义验证模块。通过结合结构和语义知识,SafeTune能够在不牺牲合法数据的情况下有效过滤投毒输入。实验结果表明,SafeTune显著提升了LLM微调的鲁棒性和可靠性,而无需修改底层模型架构。
引用
@article{arxiv.2604.27237,
title = {X-Ray Diagnostics Analysis Verification and Exploration (xDAVE) Code for the Prediction and Interpretation of X-Ray Thomson Scattering Experiments},
author = {Hannah M. Bellenbaum and Dave A. Chapman and Maximilian P. Böhme and Thomas Gawne and Sebastian Schwalbe and Willow M. Martin and Michael Bussmann and Dirk O. Gericke and Uwe Hernandez Acosta and Jan Vorberger and Tobias Dornheim},
journal= {arXiv preprint arXiv:2604.27237},
year = {2026}
}