面向针对神经排序模型的难以察觉文档操纵
信息检索
2023-05-05 v1 计算与语言
摘要
对抗攻击已受到关注,以识别神经排序模型(NRMs)中的潜在漏洞,但当前的攻击方法常引入语法错误、无意义表达或不连贯文本片段,易被检测。此外,当前方法严重依赖使用良好模仿的代理 NRM 来保证攻击效果,这使其难以在实践中使用。为解决这些问题,我们提出一种称为难以察觉文档操纵(IDEM)的框架,以生成对算法和人类均较不易察觉的对抗文档。IDEM 指导一个成熟的生成式语言模型(如 BART)生成连接句而不引入易检测错误,并采用独立的位置级合并策略来平衡扰动文本的相关性与连贯性。在流行基准 MS MARCO 上的实验结果表明,IDEM 可超越强基线,同时通过自动与人工评估证实其保持了目标文档的流畅性与正确性。此外,对抗文本生成与代理 NRM 的分离使 IDEM 更鲁棒,且更少受代理 NRM 质量的影响。
引用
@article{arxiv.2305.01860,
title = {Towards Imperceptible Document Manipulations against Neural Ranking Models},
author = {Xuanang Chen and Ben He and Zheng Ye and Le Sun and Yingfei Sun},
journal= {arXiv preprint arXiv:2305.01860},
year = {2023}
}
备注
Accepted to Findings of ACL 2023