基于机器学习的目标代码自动分类
机器学习
2018-05-08 v1 密码学与安全
机器学习
摘要
近期研究多次表明,机器学习技术可应用于整个文件或文件片段以对其分类分析。我们基于这些技术表明,对于未标注的已编译计算机目标代码样本,可施加同类分析以分类代码的重要属性,如目标体系结构与字节序。我们展示利用简单的字节值直方图,足以保留样本内 opcode 的足够信息以高精度分类目标体系结构,随后讨论基于启发式的特征,其利用操作数中的信息判定字节序。我们引入一个包含来自 20 种体系结构逾 16000 个代码样本的数据集,并通过实验表明,使用我们的特征,分类器能在相对小的样本量下达到极高准确率。
引用
@article{arxiv.1805.02146,
title = {Automatic Classification of Object Code Using Machine Learning},
author = {John Clemens},
journal= {arXiv preprint arXiv:1805.02146},
year = {2018}
}
备注
Presented/Published at Digital Forensics Workshop (DFRWS) 2015