本地研究智能体中的网络级提示与特征泄露
密码学与安全
2026-01-16 v3 人工智能
摘要
我们表明,Web 和 Research 智能体(WRAs)——基于语言模型的系统,用于在互联网上调查复杂主题——面临由被动网络观察者发起的推理攻击。组织和个人为出于隐私、法律或财务目的在本地部署 WRAs,会暴露给 DNS 解析器、恶意 ISP、VPN、Web 代理以及公司或政府防火墙。然而,与人类稀疏且不频繁的网页浏览不同,WRAs 每次请求都会访问 个域名,并呈现独特的时序模式,创造独特的隐私风险。具体而言,我们展示了一种针对 WRAs 的新型提示和用户特征泄露攻击,该攻击仅利用其网络级元数据(即访问的 IP 地址及其时序)。我们首先构建了一个基于真实用户搜索查询和由合成人格生成的查询的 WRAs 轨迹数据集。我们定义一种行为度量(称为 OBELS),全面评估原始与推断提示之间的相似性,表明该攻击恢复超过 73% 的功能和领域知识。在多会话设置下,我们可恢复最高达 32 个潜在特征中的 19 个,准确率很高。该攻击在部分可观测性和噪声条件下仍然有效。最后,我们讨论了限制域名多样性或混淆轨迹的缓解策略,表明其对实用性影响可忽略不计,同时将攻击效果降低约 29%。
引用
@article{arxiv.2508.20282,
title = {Network-Level Prompt and Trait Leakage in Local Research Agents},
author = {Hyejun Jeong and Mohammadreza Teymoorianfard and Abhinav Kumar and Amir Houmansadr and Eugene Bagdasarian},
journal= {arXiv preprint arXiv:2508.20282},
year = {2026}
}
备注
Code available at https://github.com/umass-aisec/wra