中文

Cocktail HuBERT:面向混合与单源语音的广义自监督预训练

计算与语言 2023-03-21 v1 机器学习 声音 音频与语音处理

摘要

自监督学习有效利用无标签数据,提升标签效率并泛化至无标签数据的领域。尽管近期工作已研究向更多声学/语言领域、语言和模态的泛化,这些探究局限于录音中仅有一个主要说话人的单源语音。本文提出Cocktail HuBERT,一种利用掩码伪源分离目标泛化至混合语音的自监督学习框架。该目标鼓励模型识别源数量、分离并理解上下文,以及推断表示为发现单元(discovered units)的掩码区域内容。Cocktail HuBERT在多说话人ASR上以低69%的WER、在说话人日志(diarization)上以低31%的DER优于最先进结果,并在SUPERB的单说话人与多说话人任务上具竞争力。

关键词

引用

@article{arxiv.2303.11131,
  title  = {Cocktail HuBERT: Generalized Self-Supervised Pre-training for Mixture and Single-Source Speech},
  author = {Maryam Fazel-Zarandi and Wei-Ning Hsu},
  journal= {arXiv preprint arXiv:2303.11131},
  year   = {2023}
}

备注

ICASSP 2023