中文

合成信任攻击:生成式 AI 如何操控社交工程欺诈中的人类决策

密码学与安全 2026-04-08 v1 人工智能

摘要

想象你收到来自你公司 CFO 的视频通话,他身边站着同事,要求你紧急授权一笔机密转账。你照做。通话中所有人都是假的,你只是在 2500 万美元的损失。这种情况并非假设——它发生在2024年1月的香港,并且正在成为新一代欺诈的模板。AI并未发明新的犯罪,而是将一种古老的犯罪工业化:制造信任的假象。本文提出合成信任攻击(Synthetic Trust Attacks,STAs)作为正式的威胁类别,并引入STAM(Synthetic Trust Attack Model),一个覆盖攻击链从对手情报收集到事后控制力的八阶段操作框架。核心论点是:现有的防御措施针对合成媒体检测,但真正的攻击面是受害者的决策。当人类深度伪造检测准确率仅为55.5%,略高于随机水平,而LLM诈骗代理实现46%的合规率,远高于人类操作员的18%,且完全能规避安全过滤器时,感知层已经失效。防御必须转向决策层。我们提出了五类别的信任线索分类学(Trust-Cue Taxonomy),一个可复现的17字段事件编码模式(Incident Coding Schema),并给出一个试点编码示例,以及四个将攻击结构与合规结果关联的可检验假设。本文进一步将作者实践中开发的"冷静、核查、确认"(Calm, Check, Confirm)协议正式化为科学研究中的决策层防御。合成可信度,而非合成媒体,是 AI 欺诈时代的真正攻击面。

关键词

引用

@article{arxiv.2604.04951,
  title  = {Synthetic Trust Attacks: Modeling How Generative AI Manipulates Human Decisions in Social Engineering Fraud},
  author = {Muhammad Tahir Ashraf},
  journal= {arXiv preprint arXiv:2604.04951},
  year   = {2026}
}

备注

15 pages, 3 figures, 2 tables