逐词攻击:针对检索模型的对抗攻击
信息检索
2020-08-06 v1
摘要
对抗样本通过对输入特征施加微小扰动而生成,被广泛用于欺骗分类器并衡量其对噪声输入的鲁棒性。然而,通过对抗样本评估排序模型鲁棒性的工作甚少。本文中,我们提出一种利用对抗样本衡量流行排序模型鲁棒性的系统方法。我们探索了一种简单的对抗样本生成方法,迫使排序器对文档进行错误排序。利用该方法,我们分析了多种排序模型的鲁棒性以及对抗攻击者在两个数据集上生成的扰动质量。我们的发现表明,仅需极少的词元改动(1-3个),攻击者即可生成语义相似的扰动文档,从而欺骗不同的排序器改变文档得分,使其排名下降若干位。
引用
@article{arxiv.2008.02197,
title = {One word at a time: adversarial attacks on retrieval models},
author = {Nisarg Raval and Manisha Verma},
journal= {arXiv preprint arXiv:2008.02197},
year = {2020}
}