UniSpeech-SAT:具有说话人感知预训练的通用语音表征学习
计算与语言
2021-10-13 v1 声音
音频与语音处理
摘要
自监督学习(SSL)一直是语音处理领域的长期目标,因为它利用大规模无标签数据并避免大量人工标注。近年来,自监督学习在语音识别中取得了巨大成功,但在将 SSL 应用于说话人特征建模方面的探索有限。本文旨在改进现有的 SSL 框架以用于说话人表征学习。我们引入了两种方法来增强无监督说话人信息提取。首先,我们将多任务学习应用于当前的 SSL 框架,将话语级对比损失与 SSL 目标函数相整合。其次,为了更好的说话人区分,我们提出了一种用于数据增强的话语混合策略,在无监督情况下生成额外的重叠话语并纳入训练。我们将所提方法集成到 HuBERT 框架中。在 SUPERB 基准上的实验结果表明,所提系统在通用表征学习中取得了最先进的性能,尤其是面向说话人识别的任务。消融实验验证了每种所提方法的有效性。最后,我们将训练数据集扩展到 9.4 万小时公共音频数据,并在所有 SUPERB 任务中实现了进一步的性能提升。
引用
@article{arxiv.2110.05752,
title = {UniSpeech-SAT: Universal Speech Representation Learning with Speaker Aware Pre-Training},
author = {Sanyuan Chen and Yu Wu and Chengyi Wang and Zhengyang Chen and Zhuo Chen and Shujie Liu and Jian Wu and Yao Qian and Furu Wei and Jinyu Li and Xiangzhan Yu},
journal= {arXiv preprint arXiv:2110.05752},
year = {2021}
}
备注
ICASSP 2022 Submission