分析针对序列到序列相关性模型的对抗攻击
信息检索
2024-03-13 v1
摘要
现代序列到序列相关性模型(如 monoT5)能够通过交叉编码有效捕获查询与文档之间复杂的文本交互。然而,提示词中使用的自然语言标记(如 monoT5 的 Query、Document 和 Relevant)为恶意文档提供了攻击向量,使其能够通过提示词注入操纵相关性得分(例如通过添加诸如 true 的目标词)。由于检索评估尚未考虑此类可能性,我们分析了通过手动构建的模板和基于 LLM 的文档重写所进行的与查询无关的提示词注入对几种现有相关性模型的影响。我们在 TREC Deep Learning 赛道上的实验表明,对抗性文档可以轻易操纵不同的序列到序列相关性模型,而 BM25(作为典型的词法模型)不受影响。值得注意的是,这些攻击也会影响仅编码器的相关性模型(其不依赖自然语言提示标记),尽管影响程度较小。
引用
@article{arxiv.2403.07654,
title = {Analyzing Adversarial Attacks on Sequence-to-Sequence Relevance Models},
author = {Andrew Parry and Maik Fröbe and Sean MacAvaney and Martin Potthast and Matthias Hagen},
journal= {arXiv preprint arXiv:2403.07654},
year = {2024}
}
备注
13 pages, 3 figures, Accepted at ECIR 2024 as a Full Paper