中文

迈向评估基于LLM的数字取证时间线分析的标准化方法与数据集

密码学与安全 2025-12-08 v1

摘要

大语言模型(LLM)已在包括数字取证在内的许多领域得到广泛采用。虽然先前的研究主要集中在展示LLM如何协助取证调查的案例研究和示例上,但更深入的探索仍然有限,即缺乏用于精确性能评估的标准化方法。受NIST计算机取证工具测试计划的启发,本文提出了一种标准化方法,用于定量评估LLM在数字取证任务中的应用,特别是在时间线分析方面。本文描述了该方法的组成部分,包括数据集、时间线生成和真实基准的开发。此外,本文建议使用BLEU和ROUGE指标,通过案例研究或涉及时间线分析的任务对LLM进行定量评估。使用ChatGPT的实验结果表明,所提出的方法可以有效评估基于LLM的取证时间线分析。最后,我们讨论了将LLM应用于取证时间线分析的局限性。

关键词

引用

@article{arxiv.2505.03100,
  title  = {Towards a standardized methodology and dataset for evaluating LLM-based digital forensic timeline analysis},
  author = {Hudan Studiawan and Frank Breitinger and Mark Scanlon},
  journal= {arXiv preprint arXiv:2505.03100},
  year   = {2025}
}