中文

DFIR-Metric:用于评估数字取证与应急响应中大语言模型的基准数据集

密码学与安全 2025-05-27 v1 人工智能

摘要

数字取证与应急响应(Digital Forensics and Incident Response, DFIR)涉及分析数字证据以支持法律调查。大语言模型(LLM)在日志分析和内存取证等 DFIR 任务中提供了新的机遇,但其在高风险场景中易出错和产生幻觉的倾向引发了担忧。尽管关注度日益增长,但目前尚无全面的基准来跨理论和实践 DFIR 领域评估 LLM。为了填补这一空白,我们提出了 DFIR-Metric,一个包含三个组件的基准:(1)知识评估:700 道经专家审查的多项选择题,源自行业标准认证和官方文档;(2)现实取证挑战:150 个 CTF 式任务,测试多步推理和证据关联能力;(3)实践分析:来自 NIST 计算机取证工具测试计划(CFTT)的 500 个磁盘和内存取证案例。我们使用 DFIR-Metric 评估了 14 个 LLM,分析了它们在多次试验中的准确性和一致性。我们还引入了一个新指标——任务理解得分(Task Understanding Score, TUS),旨在更有效地评估模型在准确率接近零的场景下的表现。该基准为推进人工智能在数字取证领域的应用提供了严格、可复现的基础。所有脚本、工件和结果均可在项目网站 https://github.com/DFIR-Metric 上获取。

关键词

引用

@article{arxiv.2505.19973,
  title  = {DFIR-Metric: A Benchmark Dataset for Evaluating Large Language Models in Digital Forensics and Incident Response},
  author = {Bilel Cherif and Tamas Bisztray and Richard A. Dubniczky and Aaesha Aldahmani and Saeed Alshehhi and Norbert Tihanyi},
  journal= {arXiv preprint arXiv:2505.19973},
  year   = {2025}
}