中文

SIFT——无元数据下的文件碎片分类

密码学与安全 2023-10-09 v1

摘要

数字取证中文件雕刻的一个关键问题是在文件系统元数据缺失时对文件碎片进行类型分类。过去几十年中,已有若干努力致力于开发分类文件碎片的方法。本研究提出一种新颖的筛选方法,名为 SIFT(Sifting File Types)。SIFT 比其他最先进技术至少高出 8%。(1)SIFT 与其他方法的显著区别之一在于,SIFT 将单个字节作为独立特征,即总共 256 个(0x00 - 0xFF)特征。我们亦称此为无损特征(信息)提取,即无信息损失。(2)另一显著区别在于用于估计特征类间与类内信息增益的技术。不同于其他方法,SIFT 为此采用 TF-IDF,并计算和分配权重给碎片(样本)中的每个字节(特征)。凭借这些显著差异与方法,SIFT 相较于其他工作产生了有前景(更优)的结果。

关键词

引用

@article{arxiv.2310.03831,
  title  = {SIFT -- File Fragment Classification Without Metadata},
  author = {Shahid Alam},
  journal= {arXiv preprint arXiv:2310.03831},
  year   = {2023}
}