CipherBank:通过密码学挑战探索 LLM 推理能力的边界
密码学与安全
2025-04-29 v1 人工智能
性能
摘要
大型语言模型(LLM)已展现出惊人的能力,尤其是近期在推理方面的突破,如 o1 和 o3,推动了 AI 的边界。尽管在数学和编码领域取得了令人瞩目的成就,但 LLM 在需要密码学专业知识的推理任务中仍鲜有探索。本文引入 CipherBank,一个综合性基准,用于评估 LLM 在密码解密任务中的推理能力。CipherBank 包含 2358 个精心策划的题目,覆盖 262 个唯一明文,跨 5 个领域和 14 个子领域,聚焦于需要加密保护的隐私敏感和真实场景。从密码学角度看,CipherBank 包含 3 大类加密方法,涵盖 9 种不同的算法,从古典密码到自定义密码技术。我们在 CipherBank 上评估了最新的 LLM,例如 GPT-4o、DeepSeek-V3 以及面向推理的先进模型如 o1 和 DeepSeek-R1。我们的结果揭示了通用聊天 LLM 与推理导向 LLM 之间以及当前推理导向模型在经典密码解密任务中的表现差距,凸显了这些模型在理解和操作加密数据方面的挑战。通过详细分析和错误调查,我们提供了若干关键观察,阐明了 LLM 在密码学推理中局限性及潜在改进方向。这些发现凸显了持续提升 LLM 推理能力的必要性。
引用
@article{arxiv.2504.19093,
title = {CipherBank: Exploring the Boundary of LLM Reasoning Capabilities through Cryptography Challenges},
author = {Yu Li and Qizhi Pei and Mengyuan Sun and Honglin Lin and Chenlin Ming and Xin Gao and Jiang Wu and Conghui He and Lijun Wu},
journal= {arXiv preprint arXiv:2504.19093},
year = {2025}
}
备注
Work in progress