中文

无用户标识符文本数据上的个性化语言模型学习

机器学习 2025-01-13 v1

摘要

在许多实际自然语言应用中,用户数据高度敏感,需要在不包含用户标识符的情况下从移动设备上传文本数据。然而,缺乏用户标识符限制了云端语言模型提供个性化服务的能力,而这种服务对于满足用户多样化需求至关重要。用静态用户嵌入作为模型输入取代显式用户标识符的简单方法仍可能导致数据匿名化受损。在本工作中,我们提出让每个移动设备维护一个用户特定的分布,以动态生成用户嵌入,从而打破嵌入与特定用户之间的一对一映射。我们进一步理论地表明,为防止云端通过上传的嵌入追踪用户,不同用户的局部分布应要么来源于线性相关的空间以避免可识别性,要么彼此接近以防止精确归属。通过不同的语言模型在公共和工业数据集上的评估显示,融合匿名用户嵌入在保持实时推断要求的同时,准确率显著提高。

关键词

引用

@article{arxiv.2501.06062,
  title  = {Personalized Language Model Learning on Text Data Without User Identifiers},
  author = {Yucheng Ding and Yangwenjian Tan and Xiangyu Liu and Chaoyue Niu and Fandong Meng and Jie Zhou and Ning Liu and Fan Wu and Guihai Chen},
  journal= {arXiv preprint arXiv:2501.06062},
  year   = {2025}
}