网络安全领域中使用统一模型探索迁移学习的极限
计算与语言
2023-02-22 v1 人工智能
密码学与安全
摘要
随着软件系统网络安全漏洞的增加,利用这些漏洞的方式也在增多。除此之外,恶意软件威胁、异常的网络交互以及公共论坛中关于漏洞利用的讨论也在上升。为了更快地识别这些威胁、从任意文本中检测潜在相关实体并了解软件漏洞,自动化方法是必要的。自然语言处理(NLP)技术在网络安全领域的应用有助于实现这一目标。然而,存在诸多挑战,例如网络安全领域所涉文本的多样性、大规模公开数据集的缺乏,以及雇佣领域专家进行标注的高昂成本。解决方案之一是构建可用有限数据联合训练的多任务模型。在这项工作中,我们引入了一个生成式多任务模型——统一文本到文本网络安全模型(UTS),该模型在恶意软件报告、钓鱼网站URL、编程代码结构、社交媒体数据、博客、新闻文章和公共论坛帖子上进行训练。我们展示了UTS提升了部分网络安全数据集的性能。我们还展示了仅需少量示例,UTS便可适配新颖的未见任务以及数据性质。
引用
@article{arxiv.2302.10346,
title = {Exploring the Limits of Transfer Learning with Unified Model in the Cybersecurity Domain},
author = {Kuntal Kumar Pal and Kazuaki Kashihara and Ujjwala Anantheswaran and Kirby C. Kuznia and Siddhesh Jagtap and Chitta Baral},
journal= {arXiv preprint arXiv:2302.10346},
year = {2023}
}
备注
8 pages