中文

通过私有联邦学习免费训练分词器

密码学与安全 2022-03-21 v1 计算与语言 机器学习

摘要

带有差分隐私的联邦学习,即私有联邦学习(PFL),使得在分布于用户设备上的私有数据上训练模型而不损害隐私成为可能。PFL 对于具有固定数量参数因而具有固定维梯度向量的模型(如神经网络)是高效的。这类模型包括神经网络语言模型,但不包括本文所关注的分词器。训练分词器需要来自无限词表的词频,而现有的寻找无限词表的方法需要单独的隐私预算。一种变通方法是在公开可用数据上训练分词器。然而,在本文中我们首先表明,与访问用户数据、违反隐私的“预言”分词器相比,在不匹配数据上训练的分词器会导致更差的模型性能,困惑度增加 20%。我们还表明,子词分词器比词级分词器更适合联邦场景,因为它们可以编码新词,尽管每个词需要更多 token。其次,我们提出了一种不使用任何额外隐私预算来获得分词器的新方法。在语言模型的私有联邦学习过程中,我们从模型中采样,在采样序列上训练新的分词器,并更新模型嵌入。然后我们继续私有联邦学习,并获得与“预言”分词器相差 1% 以内的性能。由于该过程仅间接在私有数据上训练分词器,我们可以利用差分隐私的“后处理保证”,从而不使用额外的隐私预算。

关键词

引用

@article{arxiv.2203.09943,
  title  = {Training a Tokenizer for Free with Private Federated Learning},
  author = {Eugene Bagdasaryan and Congzheng Song and Rogier van Dalen and Matt Seigel and Áine Cahill},
  journal= {arXiv preprint arXiv:2203.09943},
  year   = {2022}
}