随机LU分解:一种用于字典构建的算法
计算机视觉与模式识别
2018-01-30 v2
摘要
近年来,由于独特性字典构建在数据处理中的有用性,其已变得重要。通常,从一个训练数据构建出一个或多个字典,然后它们被用于分类未参与训练过程的信号。本文引入了一种新的字典构建算法。它基于通过对训练数据应用随机LU分解来实现的低秩矩阵分解。该方法快速、可扩展、可并行、消耗内存低,在这些方面优于SVD,并且在大稀疏矩阵上表现也极好。与现有方法相反,随机LU分解构建的是一个欠完备字典,这简化了新到达信号的构建和分类过程。该字典构建是通用且普遍的,适合不同应用。我们展示了该算法在文件类型识别上的能力,这是数字安全领域的一项基本任务,如今例如通过沙箱机制、深度包检测、防火墙和防病毒系统来执行。我们提出了一种基于内容的方法,检测文件类型既不依赖于文件扩展名也不依赖于元数据。这种方法更难被欺骗,并且我们表明成功分类仅需来自整个文件的少量文件片段。基于所构建的字典,我们展示了所提方法能有效识别PDF文件中的执行代码片段。 字典构建,分类,LU分解,随机LU分解,基于内容的文件检测,计算机安全。
引用
@article{arxiv.1502.04824,
title = {Randomized LU decomposition: An Algorithm for Dictionaries Construction},
author = {Aviv Rotbart and Gil Shabat and Yaniv Shmueli and Amir Averbuch},
journal= {arXiv preprint arXiv:1502.04824},
year = {2018}
}
备注
Errors in several parts of the paper. No replacement is currently available or being written