代码后门检测中的光谱特征:我们离多远?
软件工程
2025-10-17 v1 机器学习
摘要
随着大型语言模型(LLMs)越来越多地融入软件开发工作流程,也使其成为对手攻击的主要目标。在这些攻击中,后门攻击是一个重大威胁,允许攻击者通过嵌入在训练数据中的隐藏触发器来操控模型输出。检测此类后门仍是一个挑战,而一种有前景的做法是使用光谱特征防御方法,通过分析特征表示中的特征向量来识别被毒化的数据。尽管一些先前的工作探索了针对神经网络后门检测的光谱特征方法,但最近的研究表明,这些方法在代码模型上可能并非最佳。本文我们重新审视了在代码模型后门攻击情境下,光谱特征防御的适用性。我们在各种攻击场景和防御配置下系统评估了其有效性,分析了其优势和局限性。我们发现,代码后门检测中广泛使用的光谱特征设置往往并非次佳。在我们探索了关键因素的不同设置后,我们发现一种新的代理指标可更准确地估计光谱特征在防御后的实际性能,而无需重新训练模型。
引用
@article{arxiv.2510.13992,
title = {Signature in Code Backdoor Detection, how far are we?},
author = {Quoc Hung Le and Thanh Le-Cong and Bach Le and Bowen Xu},
journal= {arXiv preprint arXiv:2510.13992},
year = {2025}
}
备注
20 pages, 3 figures