中文

利用位置偏差实现查询无关的生成式搜索内容

信息检索 2024-10-10 v2

摘要

近年来,神经排序模型(NRM)在文本检索中显著优于词典化方法。然而,在传统搜索管道中,特征的组合导致行为明确。随着神经方法日益成为引擎最终评分组件或独立系统的主流,其对恶意文本以及更广泛的语义扰动的鲁棒性需要更好地理解。我们认为,Transformer 注意力机制会通过位置偏差在搜索模型中引发可被利用的缺陷,从而导致一种可超越单个查询或主题的攻击。我们通过表明非相关文本(如营销内容)可轻松注入文档而不显著影响其在搜索结果中的位置来展示此类缺陷。不同于以往基于梯度的攻击,我们以查询无关的方式展示了这些偏差。如此一来,即使不了解主题性,我们仍可通过控制注入位置来减少非相关内容注入的负面影响。我们的实验采用由 LLM 生成的模拟主题营销文本进行,结果显示,非相关文本的上下文化进一步降低了负面影响,同时可能规避现有内容过滤机制。相比之下,词典模型对此类内容注入攻击更具鲁棒性。我们随后探讨了一种简单且有效的补偿措施,以弥补 NRM 在搜索中的弱点,验证了关于 Transformer 偏差的假设。

关键词

引用

@article{arxiv.2405.00469,
  title  = {Exploiting Positional Bias for Query-Agnostic Generative Content in Search},
  author = {Andrew Parry and Sean MacAvaney and Debasis Ganguly},
  journal= {arXiv preprint arXiv:2405.00469},
  year   = {2024}
}

备注

8 pages, 4 main figures, 7 appendix pages, 2 appendix figures, Accepted to ACL 2024 Findings