检测语言模型融合 ASR 中的非预期记忆化
计算与语言
2022-06-29 v2 密码学与安全
机器学习
声音
音频与语音处理
摘要
端到端(E2E)模型常通过浅融合配以语言模型(LM)以提升整体质量及罕见词识别能力。同时,若干先前工作表明,LM 易非预期地记忆训练数据中的罕见或唯一序列。本工作中,我们设计了一个框架,用于在仅能黑盒(查询)访问 LM 融合语音识别器而非直接访问 LM 的情况下,检测 LM 训练数据中随机文本序列(我们称为 canaries)的记忆化。在一个融合 Transformer LM 的生产级 Conformer RNN-T E2E 模型上,我们展示了从 3 亿样本规模的 LM 训练数据中检测仅出现一次的 canaries 的记忆化是可行的。出于保护隐私的动机,我们还展示了通过逐样本梯度裁剪的 LM 训练可显著减少此类记忆化,且不损害整体质量。
引用
@article{arxiv.2204.09606,
title = {Detecting Unintended Memorization in Language-Model-Fused ASR},
author = {W. Ronny Huang and Steve Chien and Om Thakkar and Rajiv Mathews},
journal= {arXiv preprint arXiv:2204.09606},
year = {2022}
}
备注
Interspeech 2022