基于 AI 对话代理的安全与隐私风险诱导性用法的普遍性
密码学与安全
2025-11-03 v1
摘要
最近的大型语言模型(LLM)取得的进步使其在日常中广泛应用。与此同时,LLM 面临着包括越狱攻击在内的一系列威胁,例如在接收特定输入时导致远程代码执行。因此,用户可能无意中引入风险,例如通过上传恶意文件或披露敏感信息。然而,此类用户行为发生的程度以及因此可能促成的攻击仍然鲜有了解。为阐明此问题,我们于 2024 年在 Prolific 上对 3270 名英国成年人进行了代表性抽样调查。其中三分之一的人至少每周使用一次诸如 ChatGPT 或 Gemini 等对话代理服务。对于这些“定期用户”,最多有三分之一的人表现出可能启用攻击的行为,且四分之一的人尝试过越狱(往往是出于好奇、娱乐或信息 seeking 等易理解的原因)。半数的人表示他们对数据进行了消毒处理,大多数参与者报告未分享敏感数据。然而,很少有人分享极其敏感的数据,如密码。大多数人并不了解他们的数据可被用于训练模型,亦不知可选择退出。我们的发现表明,当前的学术威胁模型在野外得以实现,应发展出针对对话代理安全用法的缓解措施或指南。在安全和隐私方面至关重要的领域,对话代理必须具备有效的 AI 防护措施,以防止例如向好奇的员工透露敏感信息。厂商需要加大努力,以防止敏感数据进入,并就数据使用政策和设置创建透明度。
引用
@article{arxiv.2510.27275,
title = {Prevalence of Security and Privacy Risk-Inducing Usage of AI-based Conversational Agents},
author = {Kathrin Grosse and Nico Ebert},
journal= {arXiv preprint arXiv:2510.27275},
year = {2025}
}
备注
10 pages, 3 figures, 5 tables, under submission