中文

差分隐私文本生成降低输出语言质量

宇宙学与河外天体物理 2026-03-24 v2

摘要

最近,越来越多地通过对大语言模型(LLM)进行差分隐私(DP)微调来合成数据,以确保用户隐私。然而,DP 微调的 LLM 对生成文本语言质量和实用性的影响尚未被调查。本文在四种隐私级别下对五个 LLM 进行微调,并评估其生成文本的长度、语法正确性和词汇多样性。我们还探讨了合成输出在下游分类任务中的实用性,例如基于书籍描述符识别书籍类型以及基于口述死亡原因识别死亡原因。结果表明,受隐私限制微调的 LLM 生成的文本至少缩短了 77\%,语法正确性下降至少 9\%,双词汇多样性下降至少 10\%。此外,它们在下游分类任务中的准确率下降,这可能损害生成合成数据的实用性。

关键词

引用

@article{arxiv.2509.11175,
  title  = {Probing small-scale dark matter clumping with the large-scale 21-cm power spectrum},
  author = {Sudipta Sikder and Hyunbae Park and Rennan Barkana and Naoki Yoshida and Anastasia Fialkov},
  journal= {arXiv preprint arXiv:2509.11175},
  year   = {2026}
}

备注

16 pages, 5 figures, 2 tables, Accepted for publication in ApJL