中文

多模态 LLM 执行 AR 社交工程攻击的可行性研究

密码学与安全 2025-04-21 v1 人工智能

摘要

增强现实(AR)和多模态大语言模型(LLM)正在快速发展,为人机交互提供前所未有的能力。然而,它们的集成引入了新的社交工程攻击面。本文首次系统地研究了使用多模态 LLM 实施 AR 驱动社交工程攻击的可行性,通过我们提出的 SEAR 框架实现,该框架包含三个关键阶段:(1) 基于 AR 的社交情境合成,将多模态输入(视觉、听觉和环境线索)融合;(2) 基于角色的多模态 RAG(检索增强生成),动态检索和集成情境数据,同时保持角色差异化;(3) ReInteract 社交工程代理,通过推理交互循环执行自适应多阶段攻击策略。为验证 SEAR,我们进行了 IRB 批准的研究,针对60名参与者进行了三个实验配置(无辅助、AR+LLM 和完整 SEAR 流程),构建了包含 180 条标注对话的新数据集,用于模拟社交场景。我们的结果显示,SEAR 在引发高风险行为方面非常有效(例如,93.3% 的参与者对电子邮件钓鱼感到易受攻击)。该框架在建立信任方面尤为有效,85% 的目标愿意在交互后接受攻击者的电话。我们还识别出了一些局限性,如“偶尔人工”感,因为感知到的真实性存在差距。本工作为 AR-LLM 驱动的社交工程攻击提供了概念验证,并为开发针对下一代增强现实威胁的防御措施提供了见解。

关键词

引用

@article{arxiv.2504.13209,
  title  = {On the Feasibility of Using MultiModal LLMs to Execute AR Social Engineering Attacks},
  author = {Ting Bi and Chenghang Ye and Zheyu Yang and Ziyi Zhou and Cui Tang and Jun Zhang and Zui Tao and Kailong Wang and Liting Zhou and Yang Yang and Tianlong Yu},
  journal= {arXiv preprint arXiv:2504.13209},
  year   = {2025}
}