语音基础模型掩码预训练中预测目标的探索
音频与语音处理
2025-01-22 v2 声音
摘要
HuBERT及其变体等语音基础模型在大规模无标注语音数据上进行预训练,随后用于一系列下游任务。这些模型采用掩码预测目标,即模型学习从未被掩码的上下文中预测关于被掩码输入片段的信息。在该框架中,预测目标的选择会影响其在下游任务上的性能。例如,使用捕获韵律的目标进行预训练的模型会学习适合说话人相关任务的表示,而使用捕获语音特征的目标进行预训练的模型则学习适合内容相关任务的表示。此外,预测目标在捕获的细节层次上也可能有所不同。使用编码细粒度声学特征的目标进行预训练的模型在去噪等任务上表现更好,而使用专注于更高层次抽象的目标进行预训练的模型在内容相关任务上更有效。尽管预测目标非常重要,但影响它们的设计选择尚未得到深入研究。本工作探索了这些设计选择及其对下游任务性能的影响。我们的结果表明,HuBERT常用的设计选择可能是次优的。我们提出了创建更具信息量的预测目标的方法,并通过在各种下游任务上的改进证明了其有效性。
引用
@article{arxiv.2409.10788,
title = {Exploring Prediction Targets in Masked Pre-Training for Speech Foundation Models},
author = {Li-Wei Chen and Takuya Higuchi and He Bai and Ahmed Hussen Abdelaziz and Alexander Rudnicky and Shinji Watanabe and Tatiana Likhomanenko and Barry-John Theobald and Zakaria Aldeneh},
journal= {arXiv preprint arXiv:2409.10788},
year = {2025}
}
备注
ICASSP 2025