中文

DiDOTS:从大语言模型进行知识蒸馏以实现痴呆语音转录的隐私保护

计算与语言 2024-10-08 v1 密码学与安全

摘要

痴呆是一种影响全球数百万人的敏感神经认知障碍,至2050年其病例数预计将翻倍。令人警觉的是,近期的痴呆分类进展使得对方可从语音转录中推断出受影响个体的敏感健康状况。现有的文本隐私保护方法尚未用于痴呆,且依赖于大量标记数据集,而这对收集此类敏感医疗属性的数据集具有挑战。本文弥补了这一研究空白,解决上述问题,通过利用大语言模型(Large-Language-Models, LLMs)并采用多样化的提示设计(零样本、少样本和基于知识的提示)来隐私保护痴呆。我们的评估表明,LLMs在痴呆隐私保护方面比现有方法更有效。然而,LLMs拥有数十亿参数,使得训练、存储和共享变得困难,并且它们也容易受到幻觉、拒绝和矛盾等效应的影响。为进一步缓解这些问题,我们提出了一种新方法,DiDOTS。DiDOTS采用教师-学生范式从LLMs蒸馏知识,并采用参数高效微调。DiDOTS的模型参数数量仅为其教师LLM的十分之一,并且使用参数高效微调所需的参数数量仅为全参数微调的千分之一。我们的评估表明,与现有工作相比,DiDOTS在保持LLMs性能方面表现出色,在两个数据集上实现了1.3倍和2.2倍的隐私性能提升,同时人类评估显示其在保持实用性方面甚至优于当前最先进的改写模型。

关键词

引用

@article{arxiv.2410.04188,
  title  = {DiDOTS: Knowledge Distillation from Large-Language-Models for Dementia Obfuscation in Transcribed Speech},
  author = {Dominika Woszczyk and Soteris Demetriou},
  journal= {arXiv preprint arXiv:2410.04188},
  year   = {2024}
}

备注

Accepted at PoPETS 25'