二合一:一种针对文本生成模型的模型劫持攻击
密码学与安全
2023-05-15 v1 计算与语言
机器学习
摘要
机器学习在从人脸识别到文本生成的各类应用中取得了显著进展。然而其成功也伴随着多种攻击。近来出现了一种带来责任归属与寄生计算风险的新攻击,即模型劫持攻击。但该攻击此前仅聚焦于图像分类任务。本文将该攻击的适用范围拓展至文本生成与分类模型,从而展现其更广的适用性。具体而言,我们提出一种名为Ditto的新模型劫持攻击,可将不同文本分类任务劫持为多种生成任务,例如语言翻译、文本摘要与语言建模。我们使用SST-2、TweetEval、AGnews、QNLI与IMDB等一系列文本基准数据集评估攻击性能。结果表明,借助Ditto,攻击者可成功劫持文本生成模型且不损害其效用。
引用
@article{arxiv.2305.07406,
title = {Two-in-One: A Model Hijacking Attack Against Text Generation Models},
author = {Wai Man Si and Michael Backes and Yang Zhang and Ahmed Salem},
journal= {arXiv preprint arXiv:2305.07406},
year = {2023}
}
备注
To appear in the 32nd USENIX Security Symposium, August 2023, Anaheim, CA, USA