合成网络:针对语言代理epistemic弱点的对抗性精选微型 internets
人工智能
2026-03-03 v1 信息检索
摘要
语言代理日益成为支持 web 搜索、浏览和合成来自多源信息的系统。然而,这些来源可能包含不可靠或对抗性内容,而代理对对抗性排序(即误导性信息在搜索结果中占据突出位置)的鲁棒性仍然 poorly 理解。现有基准测试评估功能导航或静态事实性,无法对因果地隔离此种脆弱性,而当前针对检索增强生成的缓解策略在此类条件下也 largely 未经测试。我们引入合成网络基准测试,一个程序化生成的环境,包含数千个超链接文章,配有可信度和事实性的ground-truth标签、过程级交互痕迹,以及用于消除训练数据泄漏的过滤机制。通过将单个高可信度误导性文章注入可控的搜索排序中,我们衡量对抗暴露的因果效应,对六个前沿模型进行测试。结果显示出现灾难性失败:准确率在拥有无限可靠来源的情况下仍然崩溃,搜索升级最低,且严重失去校准。这些发现揭示了当前前沿模型处理冲突信息的根本局限,对于部署在高风险领域具有立即的意义。我们的基准测试使我们能够系统性地分析这些失效模式,为在对抗性排序下评估缓解策略提供受控测试环境——当前研究中的一个空白。本工作建立了一个可复现的基准,用于开发具备搜索鲁棒性和epistemic谦逊性的代理,能够在高风险领域抵抗操纵。
引用
@article{arxiv.2603.00801,
title = {The Synthetic Web: Adversarially-Curated Mini-Internets for Diagnosing Epistemic Weaknesses of Language Agents},
author = {Shrey Shah and Levent Ozgur},
journal= {arXiv preprint arXiv:2603.00801},
year = {2026}
}
备注
Submitted to ICML 2026, currently under review