中文

基于向量量化的无监督语音表征池化

机器学习 2023-04-11 v1 人工智能 声音 音频与语音处理

摘要

随着来自大规模自监督模型的通用语音表征的出现,将单一模型应用于多个下游任务正成为一种事实上的方法。然而,池化问题依然存在;语音表征的长度本质上是可变的。即便其忽略了语音的特征(如长度不一的音素),朴素平均池化仍常被使用。因此,我们设计了一种新颖的池化方法,通过向量量化压缩声学相似的表征,与基于注意力的池化不同,其无需额外训练。此外,我们在各种自监督模型上评估了多种无监督池化方法。我们汇集了散见于语音与文本领域的多种方法,以在多项任务上评估:关键词 spotting、说话人识别、意图分类与情感识别。最后,我们定量且定性地分析了我们的方法,并将其与有监督池化方法进行比较。

关键词

引用

@article{arxiv.2304.03940,
  title  = {Unsupervised Speech Representation Pooling Using Vector Quantization},
  author = {Jeongkyun Park and Kwanghee Choi and Hyunjun Heo and Hyung-Min Park},
  journal= {arXiv preprint arXiv:2304.03940},
  year   = {2023}
}