神经排序模型抵御词替换排序攻击的认证鲁棒性
信息检索
2022-09-15 v1
摘要
神经排序模型(NRMs)在信息检索中已取得令人瞩目的结果。NRMs 也被证明易受对抗样本的攻击。最近提出了一种典型的针对 NRMs 的词替换排序攻击(WSRA),攻击者对目标文档的文本添加人类难以察觉的扰动,从而提升该文档在排序中的名次。这在将 NRMs 部署到现实应用时引发了担忧。因此,开发抵御此类攻击的技术对 NRMs 十分重要。在经验防御中,训练期间发现对抗样本并用于扩充训练集。然而,此类方法对模型鲁棒性不提供理论保证,且可能最终被其他复杂的 WSRAs 攻破。为摆脱这种军备竞赛,需要针对 NRMs 的严格且可证明的认证防御方法。为此,我们首先定义了排序模型的“认证 Top- 鲁棒性”,因为用户在真实场景中主要关注排名靠前的结果。当一个排序模型在某一排序列表上能保证在任何攻击下都将不在前 名的文档排除在前 名之外时,称其具有认证 Top- 鲁棒性。随后,我们提出一种名为 CertDR 的认证防御方法,基于随机平滑思想实现抵御 WSRA 的认证 Top- 鲁棒性。具体而言,我们首先通过对文档施加随机词替换构造一个平滑排序器,然后利用排序性质与集成的统计性质联合可证明地认证 Top- 鲁棒性。在两个代表性网页搜索数据集上的大量实验表明,CertDR 能显著优于最先进的排序模型经验防御方法。
引用
@article{arxiv.2209.06691,
title = {Certified Robustness to Word Substitution Ranking Attack for Neural Ranking Models},
author = {Chen Wu and Ruqing Zhang and Jiafeng Guo and Wei Chen and Yixing Fan and Maarten de Rijke and Xueqi Cheng},
journal= {arXiv preprint arXiv:2209.06691},
year = {2022}
}
备注
Accepted by CIKM2022