SAFE:用于二进制相似度的自注意力函数嵌入
密码学与安全
2019-12-20 v4 机器学习
摘要
二进制相似度问题是指仅通过编译后的形式来判断两个函数是否相似。二进制相似度的先进技术近来受到关注,因为它们可应用于版权争议、恶意软件分析、漏洞检测等多个领域,因而具有直接的实际影响。现有方案先将二进制代码转化为多维向量表示(嵌入),再通过简单高效的几何运算比较向量来比较函数。然而,嵌入通常经由人工特征提取从二进制代码导出,可能未能考虑重要的函数特征,或考虑了对于二进制相似度问题并不重要的特征。本文提出 SAFE,一种基于自注意力神经网络的新型函数嵌入架构。SAFE 直接作用于反汇编的二进制函数,不需要人工特征提取,比现有方案计算更高效(即不产生构建或操纵控制流图的计算开销),且更通用,可作用于剥离二进制与多种架构。我们给出了定量与定性分析结果,表明 SAFE 相较先前方案有显著的性能提升。此外,我们展示了嵌入向量的聚类与所实现算法的语义密切相关,为进一步的趣味应用(如基于语义的二进制函数搜索)铺平了道路。
引用
@article{arxiv.1811.05296,
title = {SAFE: Self-Attentive Function Embeddings for Binary Similarity},
author = {Luca Massarelli and Giuseppe Antonio Di Luna and Fabio Petroni and Leonardo Querzoni and Roberto Baldoni},
journal= {arXiv preprint arXiv:1811.05296},
year = {2019}
}
备注
Published in International Conference on Detection of Intrusions and Malware, and Vulnerability Assessment (DIMVA) 2019