中文

基于 VQ-VAE 利用发音与声学特征的自监督语音单元发现

计算与语言 2022-06-20 v1

摘要

人类感知系统常被假定在处理听觉语音输入时会调用运动知识。本研究利用发音建模与深度学习,考察了在自监督设定下如何运用此类发音信息来发现语音单元。我们使用向量量化变分自编码器(VQ-VAE)从发音与声学语音数据中学习离散表示。依据零资源范式,随后采用 ABX 测试来探究所提取的表示如何编码语音学相关属性。实验在英语和法语的三个不同语料库上进行。我们发现,发音信息更多地依据发音部位来组织潜在表示,而语音声学主要依据发音方式构建潜在空间。我们表明,两种模态的最优融合可得到比单独考虑各模态更精确的这些语音学维度的联合表示。由于发音信息在实际情境中通常不可用,我们最后考察了当它从语音声学中以自监督方式推断时所能带来的益处。

关键词

引用

@article{arxiv.2206.08790,
  title  = {Self-supervised speech unit discovery from articulatory and acoustic features using VQ-VAE},
  author = {Marc-Antoine Georges and Jean-Luc Schwartz and Thomas Hueber},
  journal= {arXiv preprint arXiv:2206.08790},
  year   = {2022}
}