中文

Unspeech:无监督语音上下文嵌入

声音 2018-08-24 v2 计算与语言 音频与语音处理

摘要

我们引入了 “Unspeech” 嵌入,其基于针对口语的上下文特征表示的无监督学习。这些嵌入在多达 9500 小时的爬取英语语音数据上训练,无转写文本或说话人信息,采用基于上下文与非上下文判别及负采样的直接学习目标。我们使用孪生卷积神经网络架构训练 Unspeech 嵌入,并在说话人比对、语句聚类以及作为在 TED-LIUM 上训练的 TDNN-HMM 声学模型的上下文特征上对其进行评估,与 i-vector 基线进行比较。特别是在对最近发布的 Common Voice 语料库中的域外语音数据进行解码时,显示出一致的 WER 降低。我们以宽松的开源许可发布源代码与预训练的 Unspeech 模型。

关键词

引用

@article{arxiv.1804.06775,
  title  = {Unspeech: Unsupervised Speech Context Embeddings},
  author = {Benjamin Milde and Chris Biemann},
  journal= {arXiv preprint arXiv:1804.06775},
  year   = {2018}
}

备注

Accepted at Interspeech 2018, Hyderabad, India. This version matches the final version submitted to the conference