中文

CyberNER:用于网络安全命名实体识别的统一化STIX语料库

密码学与安全 2025-10-31 v1

摘要

通过命名实体识别(NER)提取结构化情报是网络安全的关键任务,但带有不兼容标注模式的数据集的 proliferation 阻碍了全面模型的开发。虽然将这些资源合并是理想的,但我们实证表明,简单拼接它们会导致噪声标签空间,从而严重降低模型性能。为克服这一关键限制,我们引入CyberNER,一个大规模统一语料库,通过系统性地将四个著名数据集(CyNER、DNRTI、APTNER和Attacker)整合到STIX 2.1标准上。我们的方法学解决了语义歧义,并将超过50个 disparate source tags 整合为21个连贯的实体类型。我们的实验表明,基于CyberNER训练的模型实现了显著的性能提升,相对于naive拼接基线,F1分数提升约30%。通过公开发布CyberNER语料库,我们提供了一个关键的、标准化的基准,使能够创建和严格比较更稳健和更通用的实体提取模型。

关键词

引用

@article{arxiv.2510.26499,
  title  = {CyberNER: A Harmonized STIX Corpus for Cybersecurity Named Entity Recognition},
  author = {Yasir Ech-Chammakhy and Anas Motii and Anass Rabii and Oussama Azrara and Jaafar Chbili},
  journal= {arXiv preprint arXiv:2510.26499},
  year   = {2025}
}

备注

Accepted for publication at the 24th IEEE International Conference on Trust, Security and Privacy in Computing and Communications (IEEE TrustCom 2025)