基于内容与统计特征的文件碎片识别
密码学与安全
2021-02-26 v1 多媒体
摘要
如今,智能手机等数字设备的快速发展和使用使人们面临网络犯罪的风险。计算机文件中现有犯罪的证据可通过更改文件前缀或其他算法而轻易无法获取。在更复杂的情况下,文件被划分为不同部分,或包含文件类型信息的文件部分被删除,这便涉及文件碎片识别问题。已知文件被划分为不同碎片,并使用不同的分类算法来解决文件碎片识别问题。由于文件碎片类型识别在网络犯罪和杀毒软件中的重要性,该问题受到高度重视,且已在许多文章中得到解决。由于所研究文件类型识别主题的敏感性,在广泛使用的文件类型上提高此领域的准确率是该领域研究人员的主要目标。未能识别正确的文件类型将导致结果和证据偏离主要问题或无法得出结论。本文首先将文件划分为不同碎片。然后,从二值频率分布中获得的文件碎片特征,通过两种特征约简算法——序列前向选择算法和序列浮动前向选择算法——进行约简,以删除稀疏特征,从而提高准确率和速度。最后,将约简后的特征输入3种多类分类器算法:多层感知机、支持向量机和K近邻,进行分类并比较结果。所提出的识别算法可识别6种有用文件类型,并且能以高于同类工作的准确率区分某类文件碎片。
引用
@article{arxiv.2102.12699,
title = {File fragment recognition based on content and statistical features},
author = {Marzieh Masoumi and Ahmad Keshavarz and Reza Fotohi},
journal= {arXiv preprint arXiv:2102.12699},
year = {2021}
}
备注
16 pages, 7 figures, 8 tables. Multimed Tools Appl (2021)