ForensicsData:用于大语言模型的数字取证数据集
密码学与安全
2025-09-09 v1 人工智能
计算与语言
摘要
网络事件的日益复杂为数字取证调查员带来了在证据收集和分析方面面临的重大挑战。尽管现实数据集对支持研究和工具开发至关重要,但由于伦理、法律和隐私顾虑,公共资源仍显不足。为弥合这一差距,我们介绍了 ForensicsData——一个来自实际恶意软件分析报告的广泛问-答-上下文(Q-C-A)数据集。该数据集包含超过 5000 组 Q-C-A 三元组。我们采用独特的工作流程创建该数据集:提取结构化数据,使用大语言模型(LLM)将其转换为 Q-C-A 格式,然后通过专门的评估过程确认其质量。在评估的模型中,Gemini 2 Flash 在与取证术语对齐生成内容方面表现最佳。ForensicsData 旨在通过实现可重复实验和促进研究社区内的合作,推动数字取证的发展。
关键词
引用
@article{arxiv.2509.05331,
title = {ForensicsData: A Digital Forensics Dataset for Large Language Models},
author = {Youssef Chakir and Iyad Lahsen-Cherif},
journal= {arXiv preprint arXiv:2509.05331},
year = {2025}
}
备注
Accepted to WiMob 2025 (21st International Conference on Wireless and Mobile Computing, Networking and Communications), Marrakesh, Morocco, Oct 20-22, 2025. 6 pages, 5 figures, 5 tables. IEEEtran conference format