面向快速数字证据发现的 Scout:利用大语言模型
密码学与安全
2025-07-25 v1
摘要
近期技术的快速发展以及日常活动中技术的普及,导致数字证据在更多法律调查中涉及的可能性显著增加。消费级硬件正变得越来越强大,内存与存储容量扩大,处理器性能提升。 Forensics 调查员往往必须在调查进行期间处理大量数据,这一过程耗时且繁琐。记忆取证、磁盘分析等领域已有成熟工具显著降低了 forensic 调查员的工作负担,这些工具提供字符串搜索、图像文件分析等功能。然而,在调查过程中往往会识别出大量的误报,需要进一步筛选。本文提出 Scout,一种数字取证框架,利用大语言模型进行初步证据处理与优先级排序。Scout 部署基础语言模型,从大量潜在证据文件(磁盘映像、捕获的网络数据包、内存转储等)中识别相关证据,这些文件传统方法下需花费更长时间。Scout 采用基于文本的大语言模型,可轻松处理包含文本信息的文件。对于音频、图像、视频、办公文档等多媒体文件的取证分析,Scout 采用多模态模型。Scout 能够识别并确认对调查员具有潜在兴趣的证据文件。
引用
@article{arxiv.2507.18478,
title = {Scout: Leveraging Large Language Models for Rapid Digital Evidence Discovery},
author = {Shariq Murtuza},
journal= {arXiv preprint arXiv:2507.18478},
year = {2025}
}