自监督学习中TrojanDec的数据免费探测Trojan输入
密码学与安全
2025-02-05 v2 人工智能
摘要
通过自监督学习预训练的图像编码器可作为通用特征提取器,用于构建针对各种下游任务的分类器。然而,许多研究表明,攻击者可将Trojan植入编码器,使得基于该被植入Trojan的编码器构建的多个下游分类器同时继承该Trojan行为。本文提出TrojanDec,这是一种首次实现的数据免费方法,用于识别和恢复被触发器嵌入的测试输入。给定(已植入或干净的)编码器和测试输入后,TrojanDec首先预测该测试输入是否被植入Trojan。如果不是,则正常处理该测试输入以维持效用。否则,该测试输入将进一步恢复以移除触发器。我们进行的广泛评估表明,TrojanDec能有效从给定测试输入中识别(如果有)被植入的Trojan,并在最先进的Trojan攻击下进行恢复。我们进一步通过实验表明,TrojanDec的防御能力超越了最先进的防御方法。
引用
@article{arxiv.2501.04108,
title = {TrojanDec: Data-free Detection of Trojan Inputs in Self-supervised Learning},
author = {Yupei Liu and Yanting Wang and Jinyuan Jia},
journal= {arXiv preprint arXiv:2501.04108},
year = {2025}
}
备注
To appear in AAAI'2025