中文

二合一:一种针对文本生成模型的模型劫持攻击

密码学与安全 2023-05-15 v1 计算与语言 机器学习

摘要

机器学习在从人脸识别到文本生成的各类应用中取得了显著进展。然而其成功也伴随着多种攻击。近来出现了一种带来责任归属与寄生计算风险的新攻击,即模型劫持攻击。但该攻击此前仅聚焦于图像分类任务。本文将该攻击的适用范围拓展至文本生成与分类模型,从而展现其更广的适用性。具体而言,我们提出一种名为Ditto的新模型劫持攻击,可将不同文本分类任务劫持为多种生成任务,例如语言翻译、文本摘要与语言建模。我们使用SST-2、TweetEval、AGnews、QNLI与IMDB等一系列文本基准数据集评估攻击性能。结果表明,借助Ditto,攻击者可成功劫持文本生成模型且不损害其效用。

关键词

引用

@article{arxiv.2305.07406,
  title  = {Two-in-One: A Model Hijacking Attack Against Text Generation Models},
  author = {Wai Man Si and Michael Backes and Yang Zhang and Ahmed Salem},
  journal= {arXiv preprint arXiv:2305.07406},
  year   = {2023}
}

备注

To appear in the 32nd USENIX Security Symposium, August 2023, Anaheim, CA, USA