中文

分段音频Word2Vec:将话语表示为向量序列及其在语音词检测中的应用

计算与语言 2018-08-08 v1

摘要

Word2Vec将(文本中的)词表示为携带语义信息的向量,而音频Word2Vec被证明能够将口语词的信号段表示为携带语音结构信息的向量。音频Word2Vec可从无标注语料中以无监督方式训练,但需要词边界。本文中,我们通过提出一种新的分段音频Word2Vec,将音频Word2Vec从词级扩展到话语级,其中无监督口语词边界分割与音频Word2Vec联合学习并相互增强,从而可将话语直接表示为携带语音结构信息的向量序列。这通过一个分段序列到序列自编码器(SSAE)实现,其中在编码器中插入了一个用强化学习训练的分割门。在英语、捷克语、法语和德语上的实验表明,在无监督口语词分割和语音词检测应用(显著优于基于帧的DTW)中均取得了非常好的性能。

关键词

引用

@article{arxiv.1808.02228,
  title  = {Segmental Audio Word2Vec: Representing Utterances as Sequences of Vectors with Applications in Spoken Term Detection},
  author = {Yu-Hsuan Wang and Hung-yi Lee and Lin-shan Lee},
  journal= {arXiv preprint arXiv:1808.02228},
  year   = {2018}
}