中文

MARFCAT:过渡到 SATE IV 的二进制和更大数据集

密码学与安全 2013-05-13 v2 编程语言 软件工程 机器学习

摘要

我们展示了基于开源 MARF 框架及其 MARFCAT 应用的机器学习方法的第二次迭代,该方法用于针对安全、软件工程等相关弱点的静态代码分析和指纹识别,使用的是 NIST SATE IV 静态分析工具博览会研讨会的数据集,其中包括额外的测试用例以及新的大型合成案例。为了辅助检测弱代码或易受攻击代码(包括不同平台上的源代码或二进制代码),事实证明该机器学习方法在此类任务中快速且准确,而其他工具要么速度慢得多,要么对已知漏洞的召回率低得多。我们在方法中使用了信号处理和自然语言处理 (NLP) 技术来完成识别和分类任务。MARFCAT 自 2010 年设计之初就独立于被分析的语言、源代码、字节码或二进制代码。在这项后续工作中,我们探讨了该领域的一些初步结果。我们还评估了用于处理数据的其他算法。

关键词

引用

@article{arxiv.1207.3718,
  title  = {MARFCAT: Transitioning to Binary and Larger Data Sets of SATE IV},
  author = {Serguei A. Mokhov and Joey Paquet and Mourad Debbabi and Yankui Sun},
  journal= {arXiv preprint arXiv:1207.3718},
  year   = {2013}
}

备注

A shorter version submitted for review to 13th IEEE International Working Conference on Source Code Analysis and Manipulation. 39 pages with figures, tables, TOC, and index