所多玛之果:通过对比学习在优越句向量中植入隐藏后门
计算与语言
2022-10-21 v1 密码学与安全
摘要
本文发现对比学习能为预训练模型生成优越的句子嵌入,但也易受后门攻击。我们提出首个针对最先进句向量在监督与无监督学习设定下的后门攻击框架 BadCSE。该攻击操纵正样本对与负样本对的构造,使得后门样本具有与目标样本(定向攻击)或其干净版本负嵌入(非定向攻击)相似的嵌入。通过在句向量中注入后门,BadCSE 能抵抗下游微调。我们在 STS 任务及其他下游任务上评估 BadCSE。监督式非定向攻击造成 194.86% 的性能退化,而定向攻击以后门样本映射到目标嵌入 97.70% 的成功率同时保持模型效用。
引用
@article{arxiv.2210.11082,
title = {Apple of Sodom: Hidden Backdoors in Superior Sentence Embeddings via Contrastive Learning},
author = {Xiaoyi Chen and Baisong Xin and Shengfang Zhai and Shiqing Ma and Qingni Shen and Zhonghai Wu},
journal= {arXiv preprint arXiv:2210.11082},
year = {2022}
}