中文

从程序性网络安全文本构建流图

计算与语言 2021-06-01 v1 人工智能 密码学与安全

摘要

遵循自然语言书写的程序性文本颇具挑战。我们必须通读整篇文本以识别相关信息,或辨识指令流以完成任务,这易于出错。若此类文本具备结构,我们便可轻松可视化指令流、推理或推断特定步骤,甚至构建自动化系统以帮助新手达成目标。然而,由于此类文本性质多样,该结构恢复任务是一项挑战。本文提出从此类文本中识别相关信息并生成句间信息流。我们构建了一个网络安全领域的大型标注程序性文本数据集(CTFW)(3154 篇文档)。该数据集包含关于软件漏洞分析经验的宝贵指令。我们在多种设置下使用我们的 LM-GNN 模型变体在 CTFW 上进行了广泛实验。为展示该任务及方法的泛化能力,我们还使用了来自另外两个领域(维护手册与烹饪)的程序性文本进行实验,其与网络安全差异显著。我们的实验表明,采用 BERT 句子嵌入的图卷积网络在所有三个领域均优于 BERT。

关键词

引用

@article{arxiv.2105.14357,
  title  = {Constructing Flow Graphs from Procedural Cybersecurity Texts},
  author = {Kuntal Kumar Pal and Kazuaki Kashihara and Pratyay Banerjee and Swaroop Mishra and Ruoyu Wang and Chitta Baral},
  journal= {arXiv preprint arXiv:2105.14357},
  year   = {2021}
}

备注

13 pages, 5 pages, accepted in the Findings of ACL 2021