中文

多数据源下的声学模型优化:合并与估值

声音 2024-10-22 v1 计算与语言 音频与语音处理

摘要

由于隐私保护意识的增强和语音数据规模的庞大,自动语音识别(ASR)系统开发者越来越难以像以前那样使用完整数据训练声学模型。例如,数据可能由不同的管理者拥有,并且不允许与他人共享。在本文中,我们提出了一种新的范式来解决困扰ASR领域的突出问题。在第一阶段,基于完整语音数据的不同子集训练多个声学模型;而在第二阶段,利用两种新颖的算法,基于在数据子集上训练的模型生成高质量的声学模型。我们首先提出了遗传合并算法(GMA),这是一种高度专门用于优化声学模型的算法,但效率较低。我们进一步提出了基于SGD的优化合并算法(SOMA),它有效缓解了GMA的效率瓶颈,并保持了优越的模型精度。在公开数据上的大量实验表明,所提出的方法可以显著优于最先进的方法。此外,我们引入Shapley值来估计训练模型的贡献分数,这对于评估数据的有效性以及为其管理者提供公平激励非常有用。

关键词

引用

@article{arxiv.2410.15620,
  title  = {Acoustic Model Optimization over Multiple Data Sources: Merging and Valuation},
  author = {Victor Junqiu Wei and Weicheng Wang and Di Jiang and Conghui Tan and Rongzhong Lian},
  journal= {arXiv preprint arXiv:2410.15620},
  year   = {2024}
}