中文

CryptoQA:面向AI辅助密码学的大规模问答数据集

密码学与安全 2025-12-03 v1 人工智能

摘要

大型语言模型(LLMs)在许多通用自然语言处理任务中表现出色。然而,其在进行深层推理和数学分析方面能力如何,尤其是对于密码学中所需的复杂任务,仍鲜有了解,主要由于缺乏适用于评估和训练的数据。为填补这一差距,我们提出CryptoQA,第一个专为密码学设计的大规模问答(QA)数据集。CryptoQA包含超过两百万个QA对,来自精选的学术来源,并附带可用于测试LLMs密码学能力以及训练新LLMs于密码学任务的上下文元数据。我们对15个最先进的LLMs在CryptoQA上进行基准测试,评估其事实准确性、数学推理、一致性、引用、逆向推理以及对对抗样本的鲁棒性。除定量指标外,我们提供专家评论,对模型输出进行定性评估并建立金标准基线。我们的结果显示,LLMs在需要形式推理和精确数学知识的任务上表现显著不足。这表明迫切需要针对密码学研究和开发的LLM助手。我们演示了使用CryptoQA,LLMs可被微调以在密码学任务上表现更好。

关键词

引用

@article{arxiv.2512.02625,
  title  = {CryptoQA: A Large-scale Question-answering Dataset for AI-assisted Cryptography},
  author = {Mayar Elfares and Pascal Reisert and Tilman Dietz and Manpa Barman and Ahmed Zaki and Ralf Küsters and Andreas Bulling},
  journal= {arXiv preprint arXiv:2512.02625},
  year   = {2025}
}