中文

Multi-resolution HuBERT:基于掩码单元预测的多分辨率语音自监督学习

声音 2024-01-31 v2 音频与语音处理

摘要

现有的语音自监督学习(SSL)模型通常以20毫秒的固定分辨率处理语音信号。这种方法忽视了语音信号中不同分辨率下存在的变化信息内容。相比之下,本文旨在将多分辨率信息纳入语音自监督表示学习。我们引入了一个SSL模型,利用分层Transformer架构,并辅以HuBERT风格的掩码预测目标,以多分辨率处理语音。实验结果表明,所提模型不仅实现了更高效的推理,而且在各项任务上展现出优于或可与原始HuBERT模型相媲美的性能。具体而言,在LibriSpeech语音识别基准上的微调实验以及使用Speech Universal PERformance Benchmark (SUPERB)和Multilingual SUPERB (ML-SUPERB)的评估中,观察到相对于原始HuBERT的显著性能提升。

关键词

引用

@article{arxiv.2310.02720,
  title  = {Multi-resolution HuBERT: Multi-resolution Speech Self-Supervised Learning with Masked Unit Prediction},
  author = {Jiatong Shi and Hirofumi Inaguma and Xutai Ma and Ilia Kulikov and Anna Sun},
  journal= {arXiv preprint arXiv:2310.02720},
  year   = {2024}
}

备注

Accepted at ICLR2024 as spotlight