中文

字节序列即图像:基于位移与n元语法嵌入的CNN文件碎片分类

计算机视觉与模式识别 2023-04-17 v1 信号处理

摘要

对小内存块进行文件碎片分类(FFC)在内存取证与互联网安全中至关重要。现有方法主要将文件碎片视为一维字节信号,并利用所捕获的字节间特征进行分类,而字节内部的位信息(即字节内信息)很少被考虑。这对于分类符号以可变位数表示的可变长度编码文件而言本质上是不合适的。相反,我们提出 Byte2Image,一种新颖的数据增强技术,将受忽视的字节内信息引入文件碎片并将其重新视为二维灰度图像,从而使我们能够通过强大的卷积神经网络(CNN)同时捕获字节间与字节内关联。具体而言,为将文件碎片转换为二维图像,我们采用滑动字节窗口来暴露被忽视的字节内信息,并将其 n-gram 特征逐行堆叠。我们进一步提出字节序列与图像融合网络作为分类器,该网络可联合建模原始一维字节序列与转换后的二维图像以执行 FFC。在 FFT-75 数据集上的实验验证了我们提出的方法在几乎所有场景下都能相较最先进方法取得显著的准确率提升。代码将于 https://github.com/wenyang001/Byte2Image 发布。

关键词

引用

@article{arxiv.2304.06983,
  title  = {A Byte Sequence is Worth an Image: CNN for File Fragment Classification Using Bit Shift and n-Gram Embeddings},
  author = {Wenyang Liu and Yi Wang and Kejun Wu and Kim-Hui Yap and Lap-Pui Chau},
  journal= {arXiv preprint arXiv:2304.06983},
  year   = {2023}
}

备注

Accepted by AICAS 2023