从大型语言模型提炼人类对齐隐私敏感性评估
计算与语言
2026-04-01 v1
摘要
准确评估文本数据的隐私敏感性 remains 是隐私保留自然语言处理中的关键挑战。最近的研究表明,大型语言模型(LLM)可作为可靠的隐私评估器,实现强与人类判断的一致性;但其计算成本和在大规模敏感数据处理中的不实用性限制了实际部署。为此,我们通过将 Mistral Large 3(675B)的隐私评估能力蒸馏到轻量级编码器模型中来弥补这一差距,所需参数仅 1.5 亿。我们利用规模庞大的隐私标注文本数据集(spanning 10 个多样化领域),训练高效分类器,既保留强与人类注释的一致性,又大幅降低计算需求。我们在人类标注测试数据上进行验证,并展示了其作为去识别系统评估指标的实际用途。
引用
@article{arxiv.2603.29497,
title = {Distilling Human-Aligned Privacy Sensitivity Assessment from Large Language Models},
author = {Gabriel Loiseau and Damien Sileo and Damien Riquet and Maxime Meyer and Marc Tommasi},
journal= {arXiv preprint arXiv:2603.29497},
year = {2026}
}
备注
Accepted to the LREC CALD-pseudo 2026 Workshop