中文

SafeSearch:面向基于LLM搜索智能体的自动化红队测试

人工智能 2026-05-29 v5 计算与语言 密码学与安全

摘要

搜索智能体将LLM连接到互联网,使其能够获取更广泛且更及时的信息,但这也引入了新的威胁表面:不可靠的搜索结果可能误导智能体产生不安全的输出。实际案例及我们在野外观察到的两个案例表明,这类失效在实际中确实可能发生。为系统性地研究此威胁,我们提出SafeSearch,一个可扩展、高性价比且轻量级的自动化红队测试框架,使其能够在沙箱环境中对搜索智能体进行安全评估。通过该框架,我们生成300个覆盖五类风险场景的测试用例(如误导信息和提示注入),并评估了三个搜索智能体架构在17个代表性LLM上的表现。我们的结果显示,基于LLM的搜索智能体存在显著的安全漏洞,在搜索工作流程场景下,GPT-4.1-mini的最高攻击成功率可达90.5%。此外,我们发现诸如提醒式提示等常见防御措施提供的保护有限。总体而言,SafeSearch为衡量和改进LLM-based搜索智能体的安全性提供了实用方法。

关键词

引用

@article{arxiv.2509.23694,
  title  = {SafeSearch: Automated Red-Teaming of LLM-Based Search Agents},
  author = {Jianshuo Dong and Sheng Guo and Hao Wang and Xun Chen and Zhuotao Liu and Tianwei Zhang and Ke Xu and Minlie Huang and Han Qiu},
  journal= {arXiv preprint arXiv:2509.23694},
  year   = {2026}
}

备注

Accepted by ICML 2026