中文

基于多分辨率 HuBERT 的探索

声音 2023-06-26 v2 音频与语音处理

摘要

隐藏单元 BERT (HuBERT) 是语音处理中广泛使用的自监督学习 (SSL) 模型。然而,我们认为其固定的 20ms 隐藏表示分辨率对于各类语音处理任务并非最优,因为这些任务的属性(如说话人特征和语义)基于不同的时间尺度。为解决此局限,我们提出在下游任务中利用多分辨率的 HuBERT 表示。我们探索了并行与层次化两种方法来整合不同分辨率的 HuBERT 特征。通过实验,我们证明多分辨率 HuBERT 优于原始模型。这凸显了在 HuBERT 等 SSL 模型中利用多分辨率以捕获语音信号中多样信息的潜力。

关键词

引用

@article{arxiv.2306.01084,
  title  = {Exploration on HuBERT with Multiple Resolutions},
  author = {Jiatong Shi and Yun Tang and Hirofumi Inaguma and Hongyu GOng and Juan Pino and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2306.01084},
  year   = {2023}
}

备注

Accepted to Interspeech2023