Calpric:使用众包和主动学习对隐私政策进行包容性细粒度标注
计算与语言
2024-01-17 v1 密码学与安全
人机交互
机器学习
摘要
在隐私政策上训练准确的深度学习模型的一个重大挑战是获取大量且全面的训练数据的成本和难度。为了应对这些挑战,我们提出了Calpric,它结合了自动文本选择和分割、主动学习以及使用众包标注者,以低成本为隐私政策生成大规模、平衡的训练集。自动文本选择和分割简化了标注任务,使来自众包平台(如Amazon的Mechanical Turk)的未经训练的标注者能够与受过训练的标注者(如法学院学生)竞争,并且还减少了标注者间的一致性,从而降低了标注成本。拥有可靠的训练标签使得能够使用主动学习,它使用更少的训练样本来高效覆盖输入空间,进一步降低成本并改善数据集中类别和数据类别的平衡。这些技术的结合使Calpric能够生成在更广泛的数据类别上准确的模型,并提供比先前工作更详细、更细粒度的标签。我们的众包过程使Calpric能够以每个标注文本段约0.92-1.71美元的成本获得可靠的标注数据。Calpric的训练过程还生成了一个包含16K个隐私政策文本段的数据集,涵盖9个数据类别,具有平衡的正负样本。
引用
@article{arxiv.2401.08038,
title = {Calpric: Inclusive and Fine-grain Labeling of Privacy Policies with Crowdsourcing and Active Learning},
author = {Wenjun Qiu and David Lie and Lisa Austin},
journal= {arXiv preprint arXiv:2401.08038},
year = {2024}
}
备注
published at USENIX Security 2023; associated website: https://www.usenix.org/conference/usenixsecurity23/presentation/qiu