Firenze:使用弱信号进行模型评估
密码学与安全
2022-07-05 v1 人工智能
机器学习
摘要
安全领域的数据标签经常是噪声大、有限或偏向于总体中的某个子集。因此,诸如准确率、精确率和召回率指标等常见评估方法,或基于带标签数据集计算性能曲线的分析,无法对机器学习(ML)模型在真实世界中的性能提供充分置信度。这减缓了机器学习在该领域的采用。在当今工业界,我们在部署新的安全应用模型前,依赖领域专业知识和冗长的手动评估来建立这种置信度。在本文中,我们介绍 Firenze,一种利用领域专业知识(编码为称为标记器的可扩展函数)对 ML 模型性能进行比较评估的新框架。我们表明,在称为感兴趣区域的选定样本子集上计算并组合的标记器可以提供对其真实世界性能的稳健估计。关键的是,我们使用统计假设检验来确保观察到的差异——以及因此从我们框架得出的结论——比仅从噪声中可观察到的更为显著。使用模拟以及用于恶意软件和域名系统信誉检测的两个真实世界数据集,我们说明了我们方法的有效性、局限性和洞察。综上,我们提出 Firenze 作为由研究人员、领域专家和业务所有者混合团队进行快速、可解释和协作式模型开发与评估的资源。
引用
@article{arxiv.2207.00827,
title = {Firenze: Model Evaluation Using Weak Signals},
author = {Bhavna Soman and Ali Torkamani and Michael J. Morais and Jeffrey Bickford and Baris Coskun},
journal= {arXiv preprint arXiv:2207.00827},
year = {2022}
}