仿生数据挖掘:将恶意软件签名视为生物序列
机器学习
2013-02-18 v1 定量方法
机器学习
摘要
机器学习在生物信息学问题上的应用已很成熟。但生物信息学技术在机器学习中的应用,特别是将非生物数据表示为生物序列,则了解较少。本文旨在探索对棘手的机器学习数据赋予氨基酸表示的效果,并评估用生物信息学工具和技术补充传统机器学习的好处。将60个计算机病毒和60个计算机蠕虫的签名转换为氨基酸表示,首先分别进行多重比对,以识别每个类别(病毒和蠕虫)内不同家族间的保守区域。随后,将所有120个比对后的签名一起进行第二次比对,以便在输入多种机器学习技术之前识别出非保守区域。第一次比对后病毒和蠕虫签名之间的长度差异通过第二次比对得以解决。我们的第一组实验表明,将计算机恶意软件签名表示为氨基酸序列并进行比对,可以提高分类和预测的准确性。第二组实验表明,将人工病毒和蠕虫数据的数据挖掘结果与已知蛋白质进行比对,可以将自然蛋白质领域的规律推广到恶意软件签名。然而,还需要进一步的工作来确定不同表示和序列比对方法在处理棘手的机器学习数据时的优缺点。
引用
@article{arxiv.1302.3668,
title = {Bio-inspired data mining: Treating malware signatures as biosequences},
author = {Ajit Narayanan and Yi Chen},
journal= {arXiv preprint arXiv:1302.3668},
year = {2013}
}