基于多分辨率 HuBERT 的探索
声音
2023-06-26 v2 音频与语音处理
摘要
隐藏单元 BERT (HuBERT) 是语音处理中广泛使用的自监督学习 (SSL) 模型。然而,我们认为其固定的 20ms 隐藏表示分辨率对于各类语音处理任务并非最优,因为这些任务的属性(如说话人特征和语义)基于不同的时间尺度。为解决此局限,我们提出在下游任务中利用多分辨率的 HuBERT 表示。我们探索了并行与层次化两种方法来整合不同分辨率的 HuBERT 特征。通过实验,我们证明多分辨率 HuBERT 优于原始模型。这凸显了在 HuBERT 等 SSL 模型中利用多分辨率以捕获语音信号中多样信息的潜力。
引用
@article{arxiv.2306.01084,
title = {Exploration on HuBERT with Multiple Resolutions},
author = {Jiatong Shi and Yun Tang and Hirofumi Inaguma and Hongyu GOng and Juan Pino and Shinji Watanabe},
journal= {arXiv preprint arXiv:2306.01084},
year = {2023}
}
备注
Accepted to Interspeech2023