信息检索诱导的 AI 代理安全性能下降
计算机与社会
2025-10-27 v2
摘要
尽管检索式 AI 代理正日益融入社会,但其安全性和伦理行为仍不充分理解。特别是将 LLM 与 AI 代理集成到外部信息源和真实环境中,引发了关于它们如何与这些外部数据源和交互环境发生作用及受其影响的关键问题。本研究探讨了扩大检索访问——从无外部来源到基于维基百科的检索和开放网页搜索——对模型可靠性、偏见传播和有害内容生成的影响。通过对限制版和未限制版 LLM 和 AI 代理进行大规模基准测试,我们的发现揭示了随着模型获取更广泛的外部访问权限,拒绝率、偏见灵敏度和有害性安全措施会持续下降,最终导致我们称之为安全性能下降的现象。值得注意的是,基于对齐 LLM 构建的检索式代理往往比无检索的未限制模型更不安全。即使在强检索准确率和基于提示的缓解措施下,这一效应仍然存在,表明检索内容的单纯存在会以结构性不安全的方式重塑模型行为。这些发现凸显了确保检索式和日益自主 AI 系统公平性和可靠性的必要性。
引用
@article{arxiv.2505.14215,
title = {Information Retrieval Induced Safety Degradation in AI Agents},
author = {Cheng Yu and Benedikt Stroebl and Diyi Yang and Orestis Papakyriakopoulos},
journal= {arXiv preprint arXiv:2505.14215},
year = {2025}
}