中文

通过注入对抗段落毒化检索语料库

计算与语言 2023-10-31 v1 信息检索

摘要

稠密检索器在各种信息检索任务中取得了最先进的性能,但它们能在多大程度上安全地部署于真实世界应用中?在这项工作中,我们提出了一种针对稠密检索系统的新型攻击:恶意用户通过扰动离散词元来生成少量对抗段落,以最大化与给定训练查询集合的相似度。当这些对抗段落被插入大型检索语料库时,我们表明该攻击能高度有效地欺骗这些系统,使其为攻击者未见过的查询检索到它们。更令人惊讶的是,这些对抗段落可直接泛化到域外查询和语料库,且攻击成功率很高——例如,我们发现基于Natural Questions优化的50个生成段落能误导金融文档或在线论坛中提出的问题的>94%。我们还对一系列最先进的稠密检索器(包括无监督和有监督)进行了基准测试与比较。尽管不同系统表现出不同程度的脆弱性,我们表明它们都可通过注入最多500个段落(与数百万段落的检索语料库相比为极小比例)而被成功攻击。

关键词

引用

@article{arxiv.2310.19156,
  title  = {Poisoning Retrieval Corpora by Injecting Adversarial Passages},
  author = {Zexuan Zhong and Ziqing Huang and Alexander Wettig and Danqi Chen},
  journal= {arXiv preprint arXiv:2310.19156},
  year   = {2023}
}

备注

EMNLP 2023. Our code is available at https://github.com/princeton-nlp/corpus-poisoning