中文

AI模型能否被劫持来骗取老年人?一种端到端评估

密码学与安全 2025-11-18 v1 人工智能 计算机与社会

摘要

我们展示了如何利用AI安全失效对易感人群造成伤害的端到端演示:从劫持大语言模型(LLM)生成钓鱼内容,到将这些信息部署针对真实目标,到成功地骗取老年受害者。我们系统评估了六个前沿LLM在四类攻击中的安全防护,发现多个模型在某些攻击向量上几乎完全易受攻击。在108名年长志愿者的人类验证研究中,AI生成的钓鱼邮件成功地骗取了11%的受试者。我们的工作独特地展示了针对老年人群的完整攻击链,凸显当前AI安全措施未能保护最易受欺诈的人群。除了生成钓鱼内容之外,LLM还使攻击者能够克服语言障碍,并以规模化方式进行多轮信任建立对话,从根本上改变了欺诈的经济学。尽管某些提供商报告了自愿的反滥用措施,但我们认为这些措施仍不足。

关键词

引用

@article{arxiv.2511.11759,
  title  = {Can AI Models be Jailbroken to Phish Elderly Victims? An End-to-End Evaluation},
  author = {Fred Heiding and Simon Lermen},
  journal= {arXiv preprint arXiv:2511.11759},
  year   = {2025}
}