从语音中学习词嵌入
计算与语言
2017-11-07 v1
摘要
在本文中,我们提出了一种新颖的深度神经网络架构 Sequence-to-Sequence Audio2Vec,用于从无标注语音语料库中提取的音频片段中无监督地学习定长向量表示,这些向量包含与片段相关的语义信息,并且在嵌入空间中若对应片段语义相似则向量彼此接近。所提模型的设计基于 RNN Encoder-Decoder 框架,并借鉴了连续 skip-gram 的训练方法。所学向量表示在 13 个广泛使用的词相似度基准上进行了评估,取得了与 GloVe 相竞争的结果。所提模型的最大优势在于能够直接从原始语音中提取音频片段的语义信息,而不依赖于任何其他模态(如文本或图像),这些模态的收集与标注具有挑战性且成本高昂。
引用
@article{arxiv.1711.01515,
title = {Learning Word Embeddings from Speech},
author = {Yu-An Chung and James Glass},
journal= {arXiv preprint arXiv:1711.01515},
year = {2017}
}
备注
Accepted by Machine Learning for Audio Signal Processing (ML4Audio), 31st Conference on Neural Information Processing Systems (NIPS 2017)