中文

信任的终点:代理AI如何破坏安全假设

密码学与安全 2026-05-19 v1 人工智能

摘要

数十年来,数字交互的安全一直依赖于一种被忽视的经济约束。攻击者面临着虚假信息保真度与其可部署规模之间的权衡。令人信服的伪装需要持续的人类努力,仅限于狭小的一组高价值目标,而大规模攻击则为覆盖率牺牲可信度。检测系统、验证机制和用户意识培训都隐式地针对这一权衡所产生的廉价虚假信息进行校准。代理AI 瓦解了这一权衡,使高保真、个性化的虚假信息可在大规模部署中被生产。我们认为,这一转变耗尽的是一种安全范式,而非仅仅加剧了威胁格局。我们引入 Infinite Impostor(无限冒充者)攻击模型,其中一个自主智能体在两个已相互信任的当事人之间插入自身,劫持现有关系,而非从零构建新关系。面向检测的防御共享一种假设,即生成式进步正在消除,合成输出可被区分于真实输出。我们提出一种默认可疑的范式,将安全从验证行为者转向评估行动,并审查当平台成为数字交互监管基石时出现的治理张力。

关键词

引用

@article{arxiv.2605.16436,
  title  = {The End of Trust: How Agentic AI Breaks Security Assumptions},
  author = {Osama Zafar and Alexander Nemecek and Erman Ayday},
  journal= {arXiv preprint arXiv:2605.16436},
  year   = {2026}
}