中文

面向隐私保护的主动学习中最大化信息增益

人机交互 2024-12-06 v2 密码学与安全 机器学习

摘要

红acted 邮件满足大多数隐私要求,但难以检测可能暗示数据外泄的异常邮件。在本文中,我们开发了一种使用信息增益最大化启发式方法的增强主动学习方法,并评估了其在实际场景中的效果——在此场景中,仅能由人类分析师对红acted 版邮件进行标注,以满足隐私要求。在第一个案例研究中,我们考察了应如何进行主动学习。我们发现,单一一位技能极佳(就标注任务而言)的分析师提供标签时,模型性能最佳。在第二个案例研究中,我们使用置信度评分来估计分析师的标注不确定性,然后根据每个实例提供的标注所能获得的预期信息增益(即模型不确定性与分析师不确定性之间的差异)对实例进行优先排序。我们发现,信息最大化增益启发式方法在主动学习的现有抽样方法中显著提升了模型性能。基于所获结果,我们建议在网络安全应用中实施主动学习前,对分析师进行筛选甚至培训。我们还建议在主动学习的早期阶段使用基于专家置信度的信息增益最大化抽样方法,以确保获得良好校准的置信度。我们还指出,应在主动学习前对分析师的专业能力进行评估,因为我们发现标注技能较低的分析师对其标签具有不良校准(过度)置信度。

关键词

引用

@article{arxiv.2405.07440,
  title  = {Maximizing Information Gain in Privacy-Aware Active Learning of Email Anomalies},
  author = {Mu-Huan Miles Chung and Sharon Li and Jaturong Kongmanee and Lu Wang and Yuhong Yang and Calvin Giang and Khilan Jerath and Abhay Raman and David Lie and Mark Chignell},
  journal= {arXiv preprint arXiv:2405.07440},
  year   = {2024}
}

备注

arXiv admin note: substantial text overlap with arXiv:2303.00870