中文

基于自监督预训练与多任务微调的语音表征学习

音频与语音处理 2021-10-20 v1 人工智能 计算与语言 机器学习 声音

摘要

语音表征学习在语音处理中起着至关重要的作用。其中,自监督学习(SSL)已成为一个重要研究方向。已有研究表明,SSL预训练模型在语音处理各类下游任务中均能取得优异性能。另一方面,有监督多任务学习(MTL)是另一种表征学习范式,已在计算机视觉(CV)与自然语言处理(NLP)中被证明有效。然而,在语音处理中,针对由有监督MTL训练的通用表征学习模型尚缺乏系统性研究。本文表明,MTL微调可进一步提升SSL预训练效果。我们分析了有监督MTL微调的泛化能力,以考察经MTL微调习得的语音表征能否泛化至未知的新任务。

关键词

引用

@article{arxiv.2110.09930,
  title  = {Speech Representation Learning Through Self-supervised Pretraining And Multi-task Finetuning},
  author = {Yi-Chen Chen and Shu-wen Yang and Cheng-Kuang Lee and Simon See and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2110.09930},
  year   = {2021}
}