MeAJOR 语料库:用于网络钓鱼邮件检测的多来源数据集
密码学与安全
2025-11-07 v2 人工智能
人机交互
摘要
网络钓鱼邮件通过利用对人类脆弱性的欺骗性内容和恶意负载持续构成针对网络安全的重大威胁。虽然机器学习(ML)模型在检测网络钓鱼威胁方面效果良好,但其性能很大程度上取决于训练数据的质量和多样性。本文提出了 MeAJOR(Merged email Assets from Joint Open-source Repositories)语料库,这是一个新的、来自多个来源的网络钓鱼邮件数据集,旨在克服现有资源中的关键局限性。它整合了 135894 个样本,代表广泛的网络钓鱼战术和合法邮件,并涵盖广泛的工程化特征。我们通过对四个分类模型(RF、XGB、MLP 和 CNN)进行系统实验来评估数据集对网络钓鱼检测研究的实用性,涵盖多种特征配置。结果突出了数据集的有效性,使用 XGB 可实现 98.34% 的 F1 分数。通过整合来自多个类别的广泛特征,我们的数据集提供了一个可重用且一致的资源,同时解决了常见挑战,如类别不平衡、可解释性和可重复性。
引用
@article{arxiv.2507.17978,
title = {MeAJOR Corpus: A Multi-Source Dataset for Phishing Email Detection},
author = {Paulo Mendes and Eva Maia and Isabel Praça},
journal= {arXiv preprint arXiv:2507.17978},
year = {2025}
}
备注
8 pages, 2 tables, WI-IAT 2025 conference