中文

为信息安全任务训练 Transformer:以恶意 URL 预测为例

密码学与安全 2020-11-06 v1 机器学习

摘要

用于信息安全(InfoSec)的机器学习(ML)利用不同的数据类型与格式,这些在原始数据上优化/训练时需要不同的处理。在本文中,我们实现了一个基于从头训练的 transformer 架构的恶意/良性 URL 预测器。我们表明,与传统的自然语言处理(NLP) transformer 不同,该模型需要不同的训练方法才能表现良好。具体而言,我们表明 1)在大规模无标签 URL 数据上对自回归任务进行预训练并不能轻易迁移到恶意/良性预测,但 2)在从头训练时使用辅助自回归损失可提升性能。我们引入了一种混合目标优化方法,动态平衡两个损失项的贡献,使其中任一项都不占主导。我们表明该方法取得的性能可与多个表现顶尖的基准分类器相媲美。

关键词

引用

@article{arxiv.2011.03040,
  title  = {Training Transformers for Information Security Tasks: A Case Study on Malicious URL Prediction},
  author = {Ethan M. Rudd and Ahmed Abdallah},
  journal= {arXiv preprint arXiv:2011.03040},
  year   = {2020}
}