揭示威胁行为者用于交付恶意附件和URL的语义与主题
机器学习
2024-07-15 v1
摘要
近期威胁报告指出,电子邮件仍是将恶意软件交付给终端节点的首要向量。尽管存在这些统计数据,但检测恶意电子邮件附件和URL时往往忽略语义线索、语言特征和上下文线索。我们研究采用BERTopic无监督主题建模来识别嵌入在用于交付恶意附件和调用动作URL的电子邮件中常见的语义和主题。我们通过提取和清理内容来预处理电子邮件,并采用类似BGE-M3的多语言嵌入模型生成稠密表示,由聚类算法(HDBSCAN和OPTICS)用于按语义相似性对电子邮件进行分组。Phi3-Mini-4K-Instruct促进语义和hLDA以理解威胁行为者模式。我们的研究将评估和比较不同聚类算法在主题数量、一致性和多样性指标上的表现,得出关于威胁行为者用于交付恶意附件和URL的常见语义和主题的见解,这一成果在威胁检测领域具有重要贡献。
引用
@article{arxiv.2407.08888,
title = {Uncovering Semantics and Topics Utilized by Threat Actors to Deliver Malicious Attachments and URLs},
author = {Andrey Yakymovych and Abhishek Singh},
journal= {arXiv preprint arXiv:2407.08888},
year = {2024}
}
备注
6 Pages, 7 Figures