差分隐私、语言公平性与训练数据影响:多语言语言模型的不可能性与可能性定理
计算与语言
2023-08-21 v1 人工智能
密码学与安全
机器学习
摘要
诸如 mBERT、XLM-R 和 BLOOM 等语言模型旨在实现多语言泛化或压缩,以促进向大量(可能未见过的)语言的迁移。然而,这些模型理想情况下还应当具备隐私性、语言公平性以及透明性,即将其预测与训练数据相关联。这些要求能否同时被满足?我们表明,多语言压缩和语言公平性与差分隐私是兼容的,但差分隐私与作为透明性目标的训练数据影响稀疏性相矛盾。我们进一步在两个常见的 NLP 任务上开展了一系列实验,并在不同的隐私保证下评估多语言压缩和训练数据影响稀疏性,更详细地探讨了这些权衡。我们的结果表明,我们需要找到联合优化这些目标的方法,以发现实际的权衡方案。
引用
@article{arxiv.2308.08774,
title = {Differential Privacy, Linguistic Fairness, and Training Data Influence: Impossibility and Possibility Theorems for Multilingual Language Models},
author = {Phillip Rust and Anders Søgaard},
journal= {arXiv preprint arXiv:2308.08774},
year = {2023}
}
备注
ICML 2023