不安全的基于 LLM 的搜索:对 AI Web 搜索中安全风险的量化分析与缓解
密码学与安全
2025-06-16 v3 人工智能
机器学习
摘要
大型语言模型(LLM)的最新进展显著提升了 AI 驱动搜索引擎(AIPSE)的能力,通过整合外部数据库与预训练知识,提供精准高效的响应。然而,我们注意到这些 AIPSE 存在引用恶意内容或引用恶意网站,导致有害或未经验证的信息传播风险。本研究通过系统性定义威胁模型、风险类型,并评估各类查询的响应,对七个生产级 AIPSE 进行首次安全风险量化。基于 PhishTank、ThreatBook 和 LevelBlue 的数据,我们发现 AIPSE 常生成包含恶意 URL 的有害内容,即使查询关键词良好(例如仅含良好关键词)。我们还观察到直接查询 URL 会增加主要风险包含的响应数量,而以自然语言查询则略有缓解此类风险。相较传统搜索引擎,AIPSE 在实用性与安全性方面均表现更佳。我们进一步进行线上文档欺骗与钓鱼两个案例研究,展示了在实际场景中轻易欺骗 AIPSE 的便利性。为缓解这些风险,我们开发了基于代理的防御系统,集成 GPT-4.1 内容细化工具与 URL 检测器。我们的评估显示,防御系统可有效降低风险,仅约降低 10.7% 的可用信息。我们的研究凸显了在 AIPSE 中构建鲁健安全措施的紧迫性。
引用
@article{arxiv.2502.04951,
title = {Unsafe LLM-Based Search: Quantitative Analysis and Mitigation of Safety Risks in AI Web Search},
author = {Zeren Luo and Zifan Peng and Yule Liu and Zhen Sun and Mingchen Li and Jingyi Zheng and Xinlei He},
journal= {arXiv preprint arXiv:2502.04951},
year = {2025}
}