SafeSearch:不要在 LLM 搜索代理中以牺牲安全性来换取实用性
计算与语言
2026-03-24 v4
摘要
基于大语言模型(LLM)的搜索代理会迭代生成查询、检索外部信息并推理以回答开放域问题。虽然研究者主要关注提高其实用性,但其安全行为仍未得到充分探讨。本文首先使用红队数据集评估搜索代理,发现它们比基础 LLM 更可能产生有害输出。例如,当被问及“如何在不知情同意的情况下追踪他人位置时”,基础模型会拒绝,而设计为检索并引用来源的搜索代理可能会降低拒绝阈值、获取文档(如法院案例),并在拼接后生成既信息丰富又不安全的摘要。我们进一步表明,实用性导向的微调会加剧这一风险,促使对安全性和实用性进行联合对齐。为此,我们提出 SafeSearch,一种多目标强化学习方法,将最终输出的安全性/实用性奖励与一种新颖的查询级别塑形项相耦合,该塑形项对不安全的查询进行惩罚并奖励安全的查询。实验表明,SafeSearch 在 7B 模型上通过三组红队数据集将代理有害性降低 90%以上,同时生成安全且有帮助的响应,保持与仅微调实用性代理相当的 QA 性能。进一步分析确认查询级别奖励在联合提高安全性和实用性方面的有效性。
引用
@article{arxiv.2510.17017,
title = {SafeSearch: Do Not Trade Safety for Utility in LLM Search Agents},
author = {Qiusi Zhan and Angeline Budiman-Chan and Abdelrahman Zayed and Xingzhi Guo and Daniel Kang and Joo-Kyung Kim},
journal= {arXiv preprint arXiv:2510.17017},
year = {2026}
}
备注
EACL 2026 Findings. Code available at https://github.com/amazon-science/SafeSearch