Cocktail HuBERT:面向混合与单源语音的广义自监督预训练
计算与语言
2023-03-21 v1 机器学习
声音
音频与语音处理
摘要
自监督学习有效利用无标签数据,提升标签效率并泛化至无标签数据的领域。尽管近期工作已研究向更多声学/语言领域、语言和模态的泛化,这些探究局限于录音中仅有一个主要说话人的单源语音。本文提出Cocktail HuBERT,一种利用掩码伪源分离目标泛化至混合语音的自监督学习框架。该目标鼓励模型识别源数量、分离并理解上下文,以及推断表示为发现单元(discovered units)的掩码区域内容。Cocktail HuBERT在多说话人ASR上以低69%的WER、在说话人日志(diarization)上以低31%的DER优于最先进结果,并在SUPERB的单说话人与多说话人任务上具竞争力。
引用
@article{arxiv.2303.11131,
title = {Cocktail HuBERT: Generalized Self-Supervised Pre-training for Mixture and Single-Source Speech},
author = {Maryam Fazel-Zarandi and Wei-Ning Hsu},
journal= {arXiv preprint arXiv:2303.11131},
year = {2023}
}
备注
ICASSP 2023