中文

Transformer模型在StackOverflow讨论中检测物联网安全问题的有效性

密码学与安全 2023-04-28 v1 机器学习 软件工程

摘要

物联网(IoT)是一个新兴概念,直接关联数十亿连接至互联网并相互收集与交换设备与系统间信息的物理实体或“物”。然而,物联网设备在设计时未考虑安全性,可能导致多设备系统中的安全漏洞。传统上,我们通过调查物联网开发者和专家来研究物联网问题。但该方法不可扩展,因为调查所有物联网开发者并不可行。另一种探究物联网问题的途径是查看物联网开发者在Stack Overflow(SO)等主流在线开发论坛上的讨论。然而,由于相关讨论常未以物联网术语分类,寻找与之相关的讨论颇具挑战。本文提出“IoT Security Dataset”,一个仅聚焦于物联网安全讨论的、包含7147个样本的领域专用数据集。由于无自动工具可标注这些样本,我们进行了人工标注。我们进一步采用多种Transformer模型自动检测安全讨论。通过严谨研究,我们发现物联网安全讨论不同于且比传统安全讨论更复杂。当从通用数据集“Opiner”迁移知识时,Transformer模型在跨域数据集上表现出显著的性能下降(高达44%),支持了我们的论断。因此,我们构建了一个领域专用的物联网安全检测器,其F1分数为0.69。我们已公开该数据集,期望开发者能更多了解安全讨论,供应商能增强对其产品安全的关注。

关键词

引用

@article{arxiv.2207.14542,
  title  = {Effectiveness of Transformer Models on IoT Security Detection in StackOverflow Discussions},
  author = {Nibir Chandra Mandal and G. M. Shahariar and Md. Tanvir Rouf Shawon},
  journal= {arXiv preprint arXiv:2207.14542},
  year   = {2023}
}