中文

面向检索增强生成的大语言模型黑盒意见操纵攻击

计算与语言 2024-07-19 v1 人工智能 密码学与安全

摘要

检索增强生成(Retrieval-Augmented Generation, RAG)被应用于解决大语言模型的幻觉问题和实时约束问题,但也引发了针对检索腐蚀攻击的漏洞。现有研究主要探讨了在白盒和封闭域问答任务中 RAG 的不可靠性。在本文中,我们旨在揭示面对黑盒意见操纵攻击时,检索增强生成(RAG)模型的漏洞。我们探讨了此类攻击对用户认知和决策的影响,为增强 RAG 模型的可靠性和安全性提供了新视角。我们通过指令操纵检索模型在 RAG 中的排序结果,并将这些结果作为数据来训练准模型。通过采用对准模型的对抗检索攻击方法,实现了对 RAG 的黑盒迁移攻击。实验在多个话题的话题数据集上进行,表明所提出的攻击策略可显著改变 RAG 生成内容的意见极性。这表明了该模型的脆弱性,更重要的是,揭示了对用户认知和决策的潜在负面影响,使其更容易误导用户接受错误或偏见信息。

关键词

引用

@article{arxiv.2407.13757,
  title  = {Black-Box Opinion Manipulation Attacks to Retrieval-Augmented Generation of Large Language Models},
  author = {Zhuo Chen and Jiawei Liu and Haotan Liu and Qikai Cheng and Fan Zhang and Wei Lu and Xiaozhong Liu},
  journal= {arXiv preprint arXiv:2407.13757},
  year   = {2024}
}

备注

10 pages, 3 figures, under review