中文

Vec2Text 是否构成新的语料 poisoning 威胁?

信息检索 2024-10-10 v1

摘要

Vec2Text——一种文本嵌入逆方法的出现,引发了对密集检索系统(使用文本嵌入)的严重隐私担忧。这一威胁源于能够从嵌入中重建原始文本的能力。在本文中,我们重新审视 Vec2Text,调查其对语料 poisoning 攻击的威胁程度,即攻击者向检索语料库注入对抗性段落,以误导密集检索器。理论上,Vec2Text 比以前的攻击方法更为危险,因为它无需访问嵌入模型的权重,即可高效生成大量对抗性段落。我们表明,在特定条件下,语料 poisoning 借助 Vec2Text 可严重威胁密集检索器系统的完整性和用户体验,通过将对抗性段落注入排名前列的位置。代码和数据已在 https://github.com/ielab/vec2text-corpus-poisoning 上提供。

关键词

引用

@article{arxiv.2410.06628,
  title  = {Does Vec2Text Pose a New Corpus Poisoning Threat?},
  author = {Shengyao Zhuang and Bevan Koopman and Guido Zuccon},
  journal= {arXiv preprint arXiv:2410.06628},
  year   = {2024}
}

备注

arXiv admin note: substantial text overlap with arXiv:2402.12784