基于众包数据与深度主动学习的隐私政策分类
密码学与安全
2025-11-04 v1 计算与语言
机器学习
摘要
隐私政策是告知用户服务数据实践情况的声明。然而,由于篇幅与复杂性,极少有用户愿意通读政策文本。尽管存在基于机器学习的自动化工具用于隐私政策分析,但为实现高分类准确率,分类器需在大型标注数据集上训练。大多数现有政策语料库由熟练人工标注者标注,需要大量的工时与精力。在本文中,我们利用主动学习与众包技术开发了名为 Calpric(Crowdsourcing Active Learning PRIvacy Policy Classifier,众包主动学习隐私政策分类器)的自动化分类工具,其能够以高准确率执行等同于熟练人工标注者的标注,同时最小化标注成本。具体而言,主动学习使分类器能够主动选择信息量最大的片段进行标注。平均而言,我们的模型仅使用原始标注工作量的 62% 即可达到相同的 F1 分数。Calpric 对主动学习的运用还解决了未标注隐私政策数据集中自然出现的类别不平衡问题,因为声明收集私人信息的语句远多于声明未收集的语句。通过从少数类中选取样本进行标注,Calpric 自动创建了更均衡的训练集。
引用
@article{arxiv.2008.02954,
title = {Deep Active Learning with Crowdsourcing Data for Privacy Policy Classification},
author = {Wenjun Qiu and David Lie},
journal= {arXiv preprint arXiv:2008.02954},
year = {2025}
}