PRADA:针对神经排序模型的实用黑盒对抗攻击
信息检索
2022-06-09 v3
摘要
神经排序模型(NRMs)近年来取得了显著成功,尤其是借助预训练语言模型。然而,深度神经模型因其对对抗样本的脆弱性而广受诟病。鉴于我们对神经信息检索模型依赖的加深,对抗攻击可能成为一种新型网络垃圾技术。因此,在部署 NRMs 之前研究潜在的对抗攻击以识别其漏洞十分重要。本文引入针对 NRMs 的词替换排序攻击(WSRA)任务,旨在通过向目标文档文本添加对抗扰动来提升其在排序中的位置。我们关注基于决策的黑盒攻击设定,即攻击者无法直接获取模型信息,仅能查询目标模型以获得部分检索列表的排名位置。该攻击设定在现实搜索引擎中是合理的。我们提出一种新颖的基于伪相关性的对抗排序攻击方法(PRADA),其基于伪相关反馈(PRF)学习替代模型以生成梯度,从而寻找对抗扰动。在两个网络搜索基准数据集上的实验表明,PRADA 能够超越现有攻击策略,并以微小且难以察觉的文本扰动成功欺骗 NRM。
引用
@article{arxiv.2204.01321,
title = {PRADA: Practical Black-Box Adversarial Attacks against Neural Ranking Models},
author = {Chen Wu and Ruqing Zhang and Jiafeng Guo and Maarten de Rijke and Yixing Fan and Xueqi Cheng},
journal= {arXiv preprint arXiv:2204.01321},
year = {2022}
}