中文

Speech2Vec:一个从语音学习词嵌入的序列到序列框架

计算与语言 2018-06-12 v2

摘要

在本文中,我们提出了一种新颖的深度神经网络架构 Speech2Vec,用于学习从语音语料库中截取的音频片段的定长向量表示,其中向量包含与底层口语词汇相关的语义信息,并且如果其对应的底层口语词汇在语义上相似,则它们在嵌入空间中彼此接近。所提出的模型可视为 Word2Vec 的语音版本。其设计基于 RNN Encoder-Decoder 框架,并借鉴了 skipgrams 或 continuous bag-of-words 的训练方法。直接从语音学习词嵌入使得 Speech2Vec 能够利用纯文本中不存在的、由语音携带的语义信息。在 13 个广泛使用的词相似度基准上对所学到的词嵌入进行了评估与分析,其表现优于 Word2Vec 从转录文本中学到的词嵌入。

关键词

引用

@article{arxiv.1803.08976,
  title  = {Speech2Vec: A Sequence-to-Sequence Framework for Learning Word Embeddings from Speech},
  author = {Yu-An Chung and James Glass},
  journal= {arXiv preprint arXiv:1803.08976},
  year   = {2018}
}

备注

Accepted to Interspeech 2018; camera-ready version. arXiv admin note: text overlap with arXiv:1711.01515