中文

TIJERE:基于分析师专家知识的威胁情报联合抽取新模型

机器学习 2026-05-05 v1

摘要

从威胁情报报告中抽取实体和关系以构建结构化格式(如网络安全知识图谱),是自动化威胁分析、检测与缓解的关键步骤。然而,现有的联合抽取方法在特征混淆、语言歧义、噪声传播和关系重叠方面存在挑战,导致准确率低下和模型性能不佳。本文提出TIJERE,一种创新的联合实体与关系抽取框架,将联合抽取形式化为多序列标记表示(MSLR)问题。具体而言,为每个实体对生成独立序列。与先前的标记方案不同,MSLR整合了专家领域特征以丰富实体的位置、上下文和语义表示,从而增强特征区分度和分类准确性。此外,TIJERE通过利用在网络安全文本上微调的 SecureBERT+(上下文语言模型)来减少语言歧义并提升领域特定的泛化能力,从而提高命名实体识别(NER)和关系抽取(RE)的性能。本文还引入了DNRTI-JE,这是第一个公开的用于网络安全实体和关系抽取的联合标注数据集,填补了网络安全威胁情报自动化的关键空白。在精选的DNRTI-JE数据集上的实证评估表明,TIJERE实现了最先进的性能,NER的F1分数超过0.93,RE的F1分数超过0.98,超越了现有方法。TIJERE与标准化的基准数据集DNRTI-JE一起,实现了高性能的网络安全情报抽取,并在医疗保健、金融和生物信息学等领域具有可迁移的应用前景。

关键词

引用

@article{arxiv.2605.02041,
  title  = {TIJERE: A Novel Threat Intelligence Joint Extraction Model Based on Analyst Expert Knowledge},
  author = {Inoussa Mouiche and Sherif Saad},
  journal= {arXiv preprint arXiv:2605.02041},
  year   = {2026}
}

备注

16 pages