迁移还是不迁移:针对迁移学习文本分类器的误分类攻击
机器学习
2020-01-09 v1 密码学与安全
信息检索
机器学习
摘要
迁移学习——即迁移已学到的知识——给模型的训练方式带来了范式转变。其在提升准确率和减少训练时间方面的显著益处,已在计算资源受限和训练样本较少的模型训练中展现出前景。具体而言,诸如 GloVe 和 BERT 等基于文本、在大型语料库上训练的公开模型已在实践中被广泛采用。在本文中,我们提出疑问:“文本预测模型中的迁移学习是否可被利用来实施误分类攻击?”作为我们的主要贡献,我们提出了新颖的攻击技术,利用教师(公开)模型中学习到的非预期特征,为学生(下游)模型生成对抗样本。据我们所知,我们的工作是首个表明从最先进的基于词和基于句子的教师模型进行迁移学习会增加学生模型对误分类攻击的敏感性的研究。首先,我们提出了一种新颖的基于词评分的攻击算法,用于针对使用上下文无关的词级嵌入模型训练的学生模型生成对抗样本。在使用 GloVe 教师模型训练的二分类任务上,我们在 IMDB 影评数据集上达到了 97% 的平均攻击准确率,在假新闻检测上达到了 80%。对于多分类任务,我们将 Newsgroup 数据集划分为 6 类和 20 类,分别达到了 75% 和 41% 的平均攻击准确率。接下来,我们针对使用上下文感知的 BERT 模型训练的假新闻检测任务,提出了基于长度和基于句子的误分类攻击,分别达到了 78% 和 39% 的攻击准确率。因此,我们的结果说明了设计对非预期特征学习具有鲁棒性的训练技术的必要性,特别是对于迁移学习模型。
引用
@article{arxiv.2001.02438,
title = {To Transfer or Not to Transfer: Misclassification Attacks Against Transfer Learned Text Classifiers},
author = {Bijeeta Pal and Shruti Tople},
journal= {arXiv preprint arXiv:2001.02438},
year = {2020}
}