中文

大型 ASR 模型中的非预期记忆及其缓解方法

机器学习 2023-10-19 v1 声音 音频与语音处理

摘要

众所周知,神经网络会非预期地记忆其训练样本,引发隐私担忧。然而,由于硬度校准等现有方法的高计算成本,审计大型非自回归自动语音识别(ASR)模型中的记忆一直具有挑战性。本工作中,我们设计了一种简单的审计方法,可在无额外计算开销的情况下度量大型 ASR 模型中的记忆。具体地,我们通过对随机生成的语音进行加速,建立声学与文本信息之间难以从典型训练样本中学得的映射。因此,仅对加速训练样本做出准确预测可作为记忆的明确证据,相应准确率可用于度量记忆。利用所提方法,我们展示了最先进 ASR 模型中的记忆现象。为缓解记忆,我们尝试在训练中使用梯度裁剪以约束任意单个样本对最终模型的影响。我们经实验表明,裁剪每个样本的梯度可缓解训练集中重复最多 16 次的加速训练样本的 memorization。此外,我们展示在大规模分布式训练中,裁剪每个计算核上的平均梯度可在保持模型质量与计算成本中性的同时提供强隐私保护。

关键词

引用

@article{arxiv.2310.11739,
  title  = {Unintended Memorization in Large ASR Models, and How to Mitigate It},
  author = {Lun Wang and Om Thakkar and Rajiv Mathews},
  journal= {arXiv preprint arXiv:2310.11739},
  year   = {2023}
}