TrojanWhisper:评估预训练 LLMs 检测和定位硬件木马的能力
密码学与安全
2024-12-11 v1 人工智能
摘要
现有的硬件木马(HT)检测方法面临若干关键限制:逻辑测试难以应对大型设计的可扩展性和覆盖率问题,侧信道分析需要黄金参考芯片,而形式化验证方法则面临状态空间爆炸问题。大型语言模型(LLMs)的出现,通过利用其自然语言理解和推理能力,为 HT 检测提供了一个有前景的新方向。本文首次探索了通用 LLMs 在检测插入到寄存器传输级(RTL)设计(包括 SRAM、AES 和 UART 模块)中的各种 HT 的潜力。为此,我们提出了一种新颖的工具,该工具系统性地评估了最先进的 LLMs(GPT-4o、Gemini 1.5 pro 和 Llama 3.1)在未进行微调的情况下检测 HT 的能力。为了解决潜在的训练数据偏差,该工具实现了扰动技术,即变量名混淆和设计重构,这使得案例对所使用 LLMs 来说更为复杂。我们的实验评估表明,GPT-4o 和 Gemini 1.5 pro 在基线场景下实现了完美的检测率(100%/100% 的精确率/召回率),两个模型都实现了比有效载荷行覆盖率(PLC: 0.32-0.46)更好的触发行覆盖率(TLC: 0.82-0.98)。在代码扰动下,虽然 Gemini 1.5 pro 保持了完美的检测性能(100%/100%),但 GPT-4o(100%/85.7%)和 Llama 3.1(66.7%/85.7%)的检测率有所下降,并且所有模型在定位触发器和有效载荷方面的准确性都有所降低。本文验证了 LLM 方法在硬件安全应用中的潜力,并指出了未来改进的方向。
引用
@article{arxiv.2412.07636,
title = {TrojanWhisper: Evaluating Pre-trained LLMs to Detect and Localize Hardware Trojans},
author = {Md Omar Faruque and Peter Jamieson and Ahmad Patooghy and Abdel-Hameed A. Badawy},
journal= {arXiv preprint arXiv:2412.07636},
year = {2024}
}