中文

基于语义通信系统中相似性的后门攻击检测

密码学与安全 2025-02-07 v1 机器学习

摘要

语义通信系统利用生成式人工智能(GAI)传输语义含义而非原始数据,有望彻底改变现代通信。然而,它们容易受到后门攻击,这是一种将恶意触发器嵌入训练数据集的投毒操纵方式。因此,后门攻击会误导对中毒样本的推理,而干净样本则不受影响。现有的防御方法可能会改变模型结构(例如神经元剪枝,这可能会降低对干净输入的推理性能),或对数据格式施加严格要求(例如“语义盾牌”要求图像-文本对)。为了解决这些局限性,本文提出了一种利用语义相似性来检测后门攻击的防御机制,无需修改模型结构或施加数据格式约束。通过分析语义特征空间中的偏差并建立一个基于阈值的检测框架,所提出的方法能够有效识别中毒样本。实验结果在不同投毒比例下均展示了高检测准确率和召回率,突显了我们所提解决方案的显著有效性。

关键词

引用

@article{arxiv.2502.03721,
  title  = {Detecting Backdoor Attacks via Similarity in Semantic Communication Systems},
  author = {Ziyang Wei and Yili Jiang and Jiaqi Huang and Fangtian Zhong and Sohan Gyawali},
  journal= {arXiv preprint arXiv:2502.03721},
  year   = {2025}
}