评估生成式搜索引擎在对抗性事实问题上的鲁棒性
计算与语言
2024-03-20 v1 人工智能
信息检索
摘要
生成式搜索引擎有望改变人们在线寻求信息的方式,但现有基于大型语言模型(LLMs)的生成式搜索引擎所生成的回复可能并不总是准确的。尽管如此,检索增强生成加剧了安全担忧,因为攻击者可能通过对声明中最脆弱的部分进行细微操纵,从而成功规避整个系统。为此,我们提出在现实且高风险的设置下评估生成式搜索引擎的鲁棒性,在该设置中攻击者仅有系统的黑盒访问权限,并试图欺骗模型返回错误的回复。通过对 Bing Chat、PerplexityAI 和 YouChat 等各种生成式搜索引擎在不同查询上进行全面的人工评估,我们证明了对抗性事实问题在诱导错误回复方面的有效性。此外,与无检索的 LLMs 相比,检索增强生成表现出更高的事实错误易感性。这些发现突显了这些系统的潜在安全风险,并强调在部署前需要进行严格的评估。
引用
@article{arxiv.2403.12077,
title = {Evaluating Robustness of Generative Search Engine on Adversarial Factual Questions},
author = {Xuming Hu and Xiaochuan Li and Junzhe Chen and Yinghui Li and Yangning Li and Xiaoguang Li and Yasheng Wang and Qun Liu and Lijie Wen and Philip S. Yu and Zhijiang Guo},
journal= {arXiv preprint arXiv:2403.12077},
year = {2024}
}
备注
21 pages, 7 figures, 4 tables