中文

分析用于预训练语音表示模型的掩码预测编码训练准则

声音 2024-01-12 v3 音频与语音处理

摘要

近期,利用自监督学习(SSL)的预训练语音表示在多种下游任务上取得了卓越成果。其中一项被称为掩码预测编码(MPC)的技术已被一些性能最优的模型所采用。在本研究中,我们使用九项探测任务,考察了MPC损失对HuBERT模型各层所学习内容类型的影响。我们的发现表明,HuBERT模型各层所学到的内容信息量与MPC损失呈正相关。此外,还观察到模型中间层所学到的任何说话人相关信息都是学习过程的间接结果,因此无法使用MPC损失加以控制。这些发现或可启发语音领域的进一步研究,特别是在开发新的预训练任务或探索能够在所学模型各层直接同时保留说话人与内容信息的新预训练准则方面。

关键词

引用

@article{arxiv.2303.06982,
  title  = {Analysing the Masked predictive coding training criterion for pre-training a Speech Representation Model},
  author = {Hemant Yadav and Sunayana Sitaram and Rajiv Ratn Shah},
  journal= {arXiv preprint arXiv:2303.06982},
  year   = {2024}
}