中文

面向生成式口语语言建模的离散自监督语音表示分析

计算与语言 2023-06-09 v3 声音 音频与语音处理

摘要

本工作通过生成式口语语言建模(GSLM)的视角深入分析离散自监督语音表示(单元)。基于该分析的结果,我们针对 GSLM 提出了对离散单元的实用改进。首先,我们从解释、可视化和重合成三个轴出发理解这些单元。我们的分析发现语音单元与音素及音素族高度相关,而其与被试者或性别的相关性较弱。此外,我们发现所提取单元中存在冗余,并认为原因之一可能是单元的上下文。遵循该分析,我们提出一种新的无监督度量来衡量单元冗余。最后,我们利用该度量开发新方法以改进单元聚类的鲁棒性,并在 ABX 等零资源语音度量上显示出显著改进。代码和分析工具可在以下链接获取:https://github.com/slp-rl/SLM-Discrete-Representations

关键词

引用

@article{arxiv.2301.00591,
  title  = {Analysing Discrete Self Supervised Speech Representation for Spoken Language Modeling},
  author = {Amitay Sicherman and Yossi Adi},
  journal= {arXiv preprint arXiv:2301.00591},
  year   = {2023}
}

备注

Accepted at ICASSP 2023