中文

智能为何失败:关于 LLM 处理密码破解的实证研究

密码学与安全 2026-01-01 v3 人工智能 机器学习

摘要

大型语言模型(LLM)在自然语言理解和生成方面展现出惊人的能力,引发了其在网络安全应用中(包括密码猜测)的潜在价值。本研究通过合成用户轮廓,对预训练 LLM 进行密码破解的效能进行经验性调查。具体而言,我们评估了 TinyLLaMA、Falcon-RW-1B 和 Flan-T5 等最新开源 LLM 的表现,通过提示它们根据结构化用户属性(如姓名、出生日期、兴趣)生成合理密码。我们的结果基于 Hit@1、Hit@5 和 Hit@10 指标(分别采用明文和 SHA-256 哈希比较),显示所有模型在 Hit@10 下的准确率始终低于 1.5%。相比之下,传统基于规则和基于组合的方法显示出显著更高的成功率。通过详细分析和可视化,我们识别出 LLM 在应用于领域特定密码猜测任务时的关键局限性。我们的发现表明,尽管拥有语言推理能力,当前的 LLM 在缺乏针对泄露密码数据集的监督微调情况下,缺乏完成有效密码推断所需的领域适应和记忆能力。这项研究为理解 LLM 在对抗性情境中的局限性提供了关键见解,为未来在安全、隐私保护和鲁棒性方面的密码建模工作奠定了基础。

关键词

引用

@article{arxiv.2510.17884,
  title  = {When Intelligence Fails: An Empirical Study on Why LLMs Struggle with Password Cracking},
  author = {Mohammad Abdul Rehman and Syed Imad Ali Shah and Abbas Anwar and Noor Islam and Hamid Khan},
  journal= {arXiv preprint arXiv:2510.17884},
  year   = {2026}
}