中文

利用指令遵循检索器进行恶意信息检索

计算与语言 2025-03-12 v1 人工智能

摘要

指令遵循检索器已在现实应用中与大型语言模型广泛搭配使用,但很少有研究探讨其不断增强的搜索能力所带来的安全风险。我们实证研究了检索器满足恶意查询的能力,包括其直接使用以及基于检索增强生成的使用方式。具体而言,我们研究了六种主流检索器,包括 NV-Embed 和 LLM2Vec,发现面对恶意请求时,大多数检索器能够在超过 50% 的查询中选出相关的有害段落。例如,LLM2Vec 对我们 61.35% 的恶意查询正确选出了相应段落。我们进一步揭示了指令遵循检索器的一个新兴风险,即通过利用其指令遵循能力,可以暴露高度相关的有害信息。最后,我们证明即使是与安全对齐的大型语言模型(如 Llama3),在上下文中提供有害检索段落时,也能满足恶意请求。总之,我们的发现强调了检索器能力不断增强所带来的恶意滥用风险。

关键词

引用

@article{arxiv.2503.08644,
  title  = {Exploiting Instruction-Following Retrievers for Malicious Information Retrieval},
  author = {Parishad BehnamGhader and Nicholas Meade and Siva Reddy},
  journal= {arXiv preprint arXiv:2503.08644},
  year   = {2025}
}