针对钓鱼与恶意软件 URL 的 VirusTotal 报告大规模研究与分类
密码学与安全
2022-05-27 v1
摘要
VirusTotal (VT) 提供关于 URL、IP 地址和二进制文件等各类实体的聚合威胁情报。研究人员与从业人员广泛使用该平台来收集真实标签并评估实体的恶意性。本文对 VT 的 URL 扫描报告进行了全面分析,涵盖两年内 15.77 亿个 URL 在 95 个扫描器下的检测结果。已知单个 VT 扫描器在检测与攻击类型分类方面存在噪声。为获得高质量的 URL 真实标签并主动采取适当措施缓解各类攻击,存在两大挑战:(1) 在噪声报告下如何判定给定 URL 是否恶意;(2) 在来自不同扫描器的相互冲突的攻击标签下,如何确定该 URL 所涉及的攻击类型(如钓鱼或恶意软件托管)。本文对不同攻击类型 URL 的 VT 扫描器行为进行了系统的比较研究。判定恶意性的常见做法是使用将 URL 报告为恶意的扫描器数量的截断阈值。然而,本文表明由于以下原因使用固定阈值是次优的:(1) 扫描器间的相关性;(2) 领先/滞后行为;(3) 扫描器的专业性;(4) 扫描器的质量与可靠性。判定攻击类型的常见做法是使用多数投票。但我们发现,由于相关扫描器带来的偏差,多数投票无法准确分类 URL 的攻击类型。为此,我们提出一种基于机器学习的方法,根据 VT 报告为 URL 分配攻击类型。
引用
@article{arxiv.2205.13155,
title = {A Large Scale Study and Classification of VirusTotal Reports on Phishing and Malware URLs},
author = {Euijin Choo and Mohamed Nabeel and Ravindu De Silva and Ting Yu and Issa Khalil},
journal= {arXiv preprint arXiv:2205.13155},
year = {2022}
}