网页检索是降低LLM代理安全对齐的漏洞
计算与语言
2026-05-29 v1 人工智能
密码学与安全
摘要
AI代理通过外部工具(如网页检索)来增强大型语言模型,实现基于事实且最新消息的响应。然而,将外部内容纳入生成管道可能削弱控制模型输出的安全对齐机制。先前的工作表明,在代理中启用检索会增加对有害请求的遵从性。我们引入AgentREVEAL,一个用于分析检索引起的安全降解的诊断框架。该框架检查两个轴向:检索如何整合到代理管道中以及检索内容的属性。在集成轴向,我们发现将工具调用与响应生成绑定在单一步骤中会放大有害输出。在内容轴向,我们发现Safe Source Paradox:即使是反对或包含风险警示的页面,也会使有害遵从率平均提高25%。最后,我们表明相关性是两种漏洞的共同激活条件。类似的模式在前沿封闭模型中也会出现,尽管在几种代表性的管道干预下,有害遵从率仍保持 elevated,某些代理也会在自主检索下进入该 regime。由于相关性也是检索有用的原因,这些结果暴露了检索代理的安全与实用性之间的权衡。我们引入HarmURLBench,包含1,405个真实世界URL配对320个有害行为,以支持未来的评估。
引用
@article{arxiv.2605.29224,
title = {Relevance as a Vulnerability: How Web Retrieval Degrades Safety Alignment in LLM Agents},
author = {Aditya Nawal and Manit Baser and Mohan Gurusamy},
journal= {arXiv preprint arXiv:2605.29224},
year = {2026}
}