中文

从原始音频中学习去标识化的韵律表征

计算与语言 2021-07-20 v1 机器学习 声音 音频与语音处理

摘要

我们提出了一种利用对比自监督信号从原始音频中学习去标识化韵律表征的方法。先前的工作依赖于以瓶颈条件化模型,而我们引入了一组利用韵律自然结构的归纳偏置,以最小化音色信息并将韵律与说话人表征解耦。尽管对输入进行了激进的下采样且无法获取语言信息,我们的模型在 DAMMP(我们为口语理解引入的新基准)上的表现与最先进的语音表征相当。我们使用最小描述长度探测表明,我们的表征有选择地学习了非音色韵律的子成分,并且乘积量化器在自然解耦它们时无需使用瓶颈。我们推导了语音去标识性的信息论定义,并用它来证明我们的韵律表征比其他语音表征更不易被标识。

关键词

引用

@article{arxiv.2107.08248,
  title  = {Learning De-identified Representations of Prosody from Raw Audio},
  author = {Jack Weston and Raphael Lenain and Udeepa Meepegama and Emil Fristed},
  journal= {arXiv preprint arXiv:2107.08248},
  year   = {2021}
}

备注

ICML 2021