神经排序模型的扰动不变对抗训练:改进有效性 - 鲁棒性权衡
信息检索
2023-12-19 v1 计算与语言
摘要
神经排序模型 (NRMs) 在信息检索 (IR) 中取得了巨大成功。但它们的预测很容易通过对抗样本被操纵,这些样本是通过对合法文档添加难以察觉的扰动而 crafted 的。这种脆弱性引发了对其可靠性的重大担忧,并阻碍了 NRMs 的广泛部署。通过将对抗样本纳入训练数据,对抗训练已成为防御针对 NRMs 对抗攻击的事实标准方法。然而,这种防御机制受制于有效性与对抗鲁棒性之间的权衡。在本研究中,我们建立了关于 NRMs 中有效性 - 鲁棒性权衡的理论保证。我们将鲁棒排序误差分解为两个分量,即用于有效性评估的自然排序误差和用于评估对抗鲁棒性的边界排序误差。然后,我们定义了排序模型的扰动不变性,并证明其是可实现计算的边界排序误差的可微上界。在我们的理论分析指导下,我们为排序模型设计了一种新颖的\emph{扰动不变对抗训练} (PIAT) 方法,以实现更好的有效性 - 鲁棒性权衡。我们设计了一种正则化代理损失,其中一项鼓励最大化有效性,而正则化项鼓励输出平滑,以提高对抗鲁棒性。在几种排序模型上的实验结果证明了 PIAT 优于现有的对抗防御方法。
引用
@article{arxiv.2312.10329,
title = {Perturbation-Invariant Adversarial Training for Neural Ranking Models: Improving the Effectiveness-Robustness Trade-Off},
author = {Yu-An Liu and Ruqing Zhang and Mingkun Zhang and Wei Chen and Maarten de Rijke and Jiafeng Guo and Xueqi Cheng},
journal= {arXiv preprint arXiv:2312.10329},
year = {2023}
}
备注
Accepted by AAAI 24