Multi-resolution HuBERT:基于掩码单元预测的多分辨率语音自监督学习
声音
2024-01-31 v2 音频与语音处理
摘要
现有的语音自监督学习(SSL)模型通常以20毫秒的固定分辨率处理语音信号。这种方法忽视了语音信号中不同分辨率下存在的变化信息内容。相比之下,本文旨在将多分辨率信息纳入语音自监督表示学习。我们引入了一个SSL模型,利用分层Transformer架构,并辅以HuBERT风格的掩码预测目标,以多分辨率处理语音。实验结果表明,所提模型不仅实现了更高效的推理,而且在各项任务上展现出优于或可与原始HuBERT模型相媲美的性能。具体而言,在LibriSpeech语音识别基准上的微调实验以及使用Speech Universal PERformance Benchmark (SUPERB)和Multilingual SUPERB (ML-SUPERB)的评估中,观察到相对于原始HuBERT的显著性能提升。
引用
@article{arxiv.2310.02720,
title = {Multi-resolution HuBERT: Multi-resolution Speech Self-Supervised Learning with Masked Unit Prediction},
author = {Jiatong Shi and Hirofumi Inaguma and Xutai Ma and Ilia Kulikov and Anna Sun},
journal= {arXiv preprint arXiv:2310.02720},
year = {2024}
}
备注
Accepted at ICLR2024 as spotlight