基于字节级生成预测的数字 Forensic 多媒体雕刻
计算机视觉与模式识别
2026-04-14 v1
摘要
数字 forensic 调查常面临在恢复缺乏文件系统元数据的碎片化多媒体文件时的重大挑战。虽然传统文件雕刻依赖签名和判别式深度学习模型进行碎片分类,但这些方法无法重建或预测缺失数据。我们提出一种基于 bGPT 的生成式方法,用于多媒体雕刻。bGPT 是一种用于下一字节预测的字节级转换器。通过输入部分 BMP 图像数据来模拟生成可能的碎片延续。我们使用不同的指标评估这些预测的保真度,包括余弦相似性、结构相似性指数 (SSIM)、卡方距离和 Jensen-Shannon 散度 (JSD)。我们的发现表明,生成模型能够有效预测字节级模式,以支持未分配磁盘空间中的碎片匹配。
引用
@article{arxiv.2604.11010,
title = {Byte-level generative predictions for forensics multimedia carving},
author = {Jaewon Lee and Md Eimran Hossain Eimon and Avinash Srinivasan and Hari Kalva},
journal= {arXiv preprint arXiv:2604.11010},
year = {2026}
}
备注
Accepted for publication at the "SPIE Defense + Security" Conference