中文

基于图嵌入神经网络的无监督特征提取用于二进制相似性分析

机器学习 2018-11-14 v2 分布式、并行与集群计算

摘要

本文考虑二进制相似性问题,即仅根据编译形式判断两个二进制函数是否相似。该问题在若干应用场景中至关重要,如版权争议、恶意软件分析、漏洞检测等。当前该领域最先进的解决方案通过构建嵌入模型,将二进制函数映射为Rn\mathbb{R}^{n}中的向量。此类嵌入模型捕捉二进制之间的语法与语义相似性,即相似的二进制函数被映射到向量空间中相近的点。该策略具有诸多优势,其中之一是可预计算若干二进制函数的嵌入,随后通过简单几何运算(如点积)进行比较。在[32]中,函数首先被转化为由人工设计特征构成的带标注控制流图(ACFGs),随后使用深度神经网络架构将图嵌入为向量。本文提出并测试了多种计算带标注控制流图的方法,其采用无监督方式进行特征学习,从而避免人为偏差。我们的方法受自然语言处理领域技术启发(例如使用word2vec编码汇编指令)。我们表明该方法确实成功,且性能优于先前最先进的解决方案。此外,我们给出了函数嵌入的定性分析。我们发现了一些有趣案例,其中嵌入根据原始二进制函数的语义进行了聚类。

关键词

引用

@article{arxiv.1810.09683,
  title  = {Unsupervised Features Extraction for Binary Similarity Using Graph Embedding Neural Networks},
  author = {Roberto Baldoni and Giuseppe Antonio Di Luna and Luca Massarelli and Fabio Petroni and Leonardo Querzoni},
  journal= {arXiv preprint arXiv:1810.09683},
  year   = {2018}
}