针对黑盒神经排序模型的多粒度对抗攻击
信息检索
2024-04-12 v2 密码学与安全
机器学习
摘要
对抗性排序攻击因其在探测神经排序模型漏洞并进而增强其鲁棒性方面的成功而日益受到关注。传统攻击方法在针对文档时采用单一粒度(例如词级或句子级)的扰动。然而,将扰动限制在单一粒度可能会降低对抗样本的灵活性,从而削弱攻击的潜在威胁。因此,我们专注于通过引入多粒度扰动来生成高质量的对抗样本。实现这一目标需要解决组合爆炸问题,即需要在所有可能的粒度、位置和文本片段中识别出最优的扰动组合。为应对这一挑战,我们将多粒度对抗攻击转化为一个序列决策过程,其中下一步攻击步骤中的扰动建立在当前攻击步骤中已扰动的文档之上。由于攻击过程只能访问最终状态而没有直接的中间信号,我们使用强化学习来执行多粒度攻击。在强化学习过程中,两个智能体协同工作,识别多粒度漏洞作为攻击目标,并将候选扰动组织成最终的扰动序列。实验结果表明,我们的攻击方法在攻击有效性和隐蔽性方面均超越了现有基线方法。
引用
@article{arxiv.2404.01574,
title = {Multi-granular Adversarial Attacks against Black-box Neural Ranking Models},
author = {Yu-An Liu and Ruqing Zhang and Jiafeng Guo and Maarten de Rijke and Yixing Fan and Xueqi Cheng},
journal= {arXiv preprint arXiv:2404.01574},
year = {2024}
}
备注
Accepted by SIGIR2024