ByteNet:从视觉视角重新思考多媒体文件碎片分类
计算机视觉与模式识别
2024-10-29 v1 密码学与安全
多媒体
摘要
多媒体文件碎片分类(MFFC)旨在没有系统元数据的情况下识别文件碎片类型,例如图像/视频、音频和文本。这对于多媒体存储与通信至关重要。现有的 MFFC 方法通常将碎片视为一维字节序列,并强调独立字节间(interbytes)的关系进行分类。然而,更具信息量的字节内部(intrabytes)关系却被忽视且鲜有研究。通过观察字节内部,可以获取文件碎片的位级细节,从而实现更准确的分类。受此启发,我们首先提出了 Byte2Image,一种新颖的视觉表示模型,该模型将此前被忽视的字节内部信息融入文件碎片,并将这些碎片重新解释为二维灰度图像。该模型使用滑动字节窗口来揭示字节内部信息,并通过字节内部 ngram 的逐行堆叠将碎片嵌入到二维空间中。因此,可以利用强大的视觉网络同时挖掘复杂的字节间与字节内部相关性。此外,我们提出了一种端到端的双分支网络 ByteNet,以增强稳健的相关性挖掘与特征表示。ByteNet 通过浅层字节分支特征提取(BBFE)和深层图像分支特征提取(IBFE)网络,充分利用了原始的一维字节序列和转换后的二维图像。具体而言,由单个全连接层组成的 BBFE 自适应地识别原始字节序列中某些特定字节的共现,而基于视觉 Transformer 构建的 IBFE 则从转换后的图像中有效挖掘复杂的字节间与字节内部相关性。在两个代表性基准(包含 14 个案例)上的实验验证了本文所提方法在不同案例中比 SOTA 方法最高提升 12.2%。
引用
@article{arxiv.2410.20855,
title = {ByteNet: Rethinking Multimedia File Fragment Classification through Visual Perspectives},
author = {Wenyang Liu and Kejun Wu and Tianyi Liu and Yi Wang and Kim-Hui Yap and Lap-Pui Chau},
journal= {arXiv preprint arXiv:2410.20855},
year = {2024}
}
备注
Accepted in TMM