Audio Word2Vec:基于序列到序列自编码器的音频段表示无监督学习
声音
2016-06-14 v4 机器学习
摘要
Word2Vec所提供的词(文本中)的固定维向量表示已被证明在许多应用场景非常有用,特别是由于它们携带的语义信息。本文提出其并行版本,即Audio Word2Vec。它为变长音频段提供固定维向量表示。这些向量表示被证明能较好地描述音频段的序列音素结构,并具有极具吸引力的现实应用,例如基于示例的口语术语检测(STD)。在该STD应用中,所提方法以显著更低的计算需求大幅优于传统的基于动态时间规整(DTW)的方法。我们提出利用序列到序列自编码器(SA)从无需人工标注的音频数据无监督学习Audio Word2Vec。SA由两个配备长短期记忆(LSTM)单元的RNN组成:第一个RNN(编码器)将输入音频序列映射为固定维向量表示,第二个RNN(解码器)将该表示映射回输入音频序列。两个RNN通过最小化重构误差联合训练。进一步提出了去噪序列到序列自编码器(DSA)以提供更鲁棒的学习。
引用
@article{arxiv.1603.00982,
title = {Audio Word2Vec: Unsupervised Learning of Audio Segment Representations using Sequence-to-sequence Autoencoder},
author = {Yu-An Chung and Chao-Chung Wu and Chia-Hao Shen and Hung-Yi Lee and Lin-Shan Lee},
journal= {arXiv preprint arXiv:1603.00982},
year = {2016}
}