中文

DeDe:基于解码器检测SSL编码器中的后门样本

机器学习 2025-03-21 v2 密码学与安全

摘要

自监督学习(SSL)被广泛用于利用大量无标签数据训练高质量的上游编码器。然而发现其仅通过污染少量训练数据即可受到后门攻击的威胁。受害者编码器将触发输入与目标嵌入关联,例如将触发的猫图像映射到飞机嵌入,从而在触发器被激活时,使得下游任务继承意外行为。近期后门攻击在不同SSL范例中(如对比学习和CLIP)显示出巨大的威胁,但针对此类攻击的防御研究有限,现有防御方法检测效果不足。为此,本文提出一种新型检测机制DeDe,通过解码器检测受害者编码器对触发输入引发的后门映射。具体而言,DeDe使用辅助数据集(可为分布外数据或轻度受污染数据)为给定的SSL编码器训练解码器,以便对于导致编码器产生目标嵌入的任何触发输入,解码器生成的输出图像与输入图像之间存在显著差异。DeDe利用输入与解码输出之间的差异,以识别推理期间潜在的后门异常行为。我们在对比学习和CLIP模型上针对各种后门攻击进行了实证评估。结果显示,DeDe在各种高级攻击上表现出有希望的检测效果,并在多种先进检测方法中表现出优越性能。

关键词

引用

@article{arxiv.2411.16154,
  title  = {DeDe: Detecting Backdoor Samples for SSL Encoders via Decoders},
  author = {Sizai Hou and Songze Li and Duanyi Yao},
  journal= {arXiv preprint arXiv:2411.16154},
  year   = {2025}
}

备注

To appear on CVPR 2025