理解网络安全中的数据标注过程
密码学与安全
2023-12-12 v1
摘要
许多领域现在都在利用机器学习(ML)的优势,其有望通过在某些数据上训练来自主学会解决复杂任务。不幸的是,在网威胁检测中,高质量数据难以获得。此外,对于 ML 的某些特定应用,此类数据必须由人类操作员标注。许多工作“假设”在网威胁检测中标注是困难/具有挑战性/昂贵的,从而提出解决该障碍的方案。然而,我们发现没有工作专门从 ML 安全从业者的视角探讨标注过程。这是一个问题:迄今为止,实践中标注究竟如何完成大多未知——从而妨碍人们指明现实世界中“需要什么”。本文中,我们在数据标注背景下迈出建立学术研究与安全实践之间桥梁的第一步。首先,我们联系五位主题专家并进行开放式访谈,以识别其标注常规中的痛点。然后,以我们的发现为框架,我们对来自大型安全公司的 13 名从业者开展用户研究,并就主动学习、标注成本及标签修订等主题询问详细问题。最后,我们进行概念验证实验,探讨网威胁检测中研究中时有忽视的标注相关方面。总之,我们的贡献与建议可作为未来旨在提升 ML 驱动安全系统质量与鲁棒性工作的踏脚石。我们公开了我们的资源。
引用
@article{arxiv.2311.16388,
title = {Understanding the Process of Data Labeling in Cybersecurity},
author = {Tobias Braun and Irdin Pekaric and Giovanni Apruzzese},
journal= {arXiv preprint arXiv:2311.16388},
year = {2023}
}