中文

基于字节袋的URL比特流分类

网络与互联网体系结构 2021-11-12 v1 人工智能

摘要

保护用户免受恶意网站访问是网络运营商的重要管理任务之一。有许多开源和商业产品用于控制用户可访问的网站。最传统的方法是基于黑名单的过滤。该机制简单但可扩展性差,尽管存在一些利用模糊匹配技术的增强方法。其他方法试图通过从URL字符串中提取特征来使用机器学习(ML)技术。这种方法可以覆盖更广的互联网网站范围,但寻找良好特征需要深入了解网站设计趋势。最近,出现了另一种使用深度学习(DL)的方法。DL方法将通过研究大量现有样本数据来帮助自动提取特征。利用该技术,我们可以构建一个灵活的过滤决策模块,通过不断向神经网络模块灌输近期趋势,而无需任何关于URL领域的特定专家知识。在本文中,我们应用一种机械方法从URL字符串生成特征向量。我们实现了我们的方法,并使用从某研究机构获取的真实URL访问历史数据以及著名钓鱼网站信息存档站点PhishTank.com的数据进行了测试。与现有的基于DL的方法相比,我们的方法实现了2~3%更高的准确率。

关键词

引用

@article{arxiv.2111.06087,
  title  = {Classification of URL bitstreams using Bag of Bytes},
  author = {Keiichi Shima and Daisuke Miyamoto and Hiroshi Abe and Tomohiro Ishihara and Kazuya Okada and Yuji Sekiya and Hirochika Asai and Yusuke Doi},
  journal= {arXiv preprint arXiv:2111.06087},
  year   = {2021}
}