Transformer 用于端到端信息安全任务的可行性研究
摘要
在本文中,我们评估了 transformer 模型在端到端信息安全(InfoSec)场景中的可行性,其中模型外部不发生任何中间特征表示或处理步骤。我们针对两种截然不同的 InfoSec 数据格式——具体而言是 URL 和 PE 文件——以新颖的端到端方法实现 transformer 模型,并探索多种架构设计、训练机制和实验设置,以确定构建高性能检测模型所需的要素。我们表明,与在更标准的 NLP 相关任务上训练的传统 transformer 相比,我们的 URL transformer 模型需要不同的训练方法才能达到高性能水平。具体而言,我们表明:1)在大规模无标注 URL 数据上针对自回归任务进行预训练并不能轻易迁移到恶意或良性 URL 的二分类,但 2)在从头训练时使用辅助自回归损失可提升性能。我们引入一种混合目标优化方法,动态平衡两个损失项的贡献,使其中任一项都不会占主导。我们表明,该方法产生的定量评估指标可与多个性能领先的基准分类器相媲美。与 URL 不同,二进制可执行文件包含更长且更分散的信息丰富字节序列。为容纳此类长字节序列,我们通过为 transformer 的自注意力层提供类似于 Sukhbaatar 等人的自适应跨度,从而引入额外的上下文长度。我们证明,该方法在基准 PE 文件数据集上的表现与成熟的恶意软件检测模型相当,但也指出需要进一步探索模型在可扩展性和计算效率方面的改进。
引用
@article{arxiv.2212.02666,
title = {Transformers for End-to-End InfoSec Tasks: A Feasibility Study},
author = {Ethan M. Rudd and Mohammad Saidur Rahman and Philip Tully},
journal= {arXiv preprint arXiv:2212.02666},
year = {2022}
}
备注
Post-print of a manuscript accepted to ACM Asia-CCS Workshop on Robust Malware Analysis (WoRMA) 2022. 11 Pages total. arXiv admin note: substantial text overlap with arXiv:2011.03040