中文

音频词向量的语言迁移:在无目标语言数据下学习音频片段表征

计算与语言 2018-02-20 v1 机器学习

摘要

音频词向量(Audio Word2Vec)利用序列到序列自编码器(SA)为可变长度的音频片段提供固定维度的向量表征。这些向量表征能够较好地描述音频片段的序列语音结构,并已应用于基于样例查询的口语词检测(STD)等现实任务。本文考察了音频词向量的语言迁移能力。我们使用一种语言(源语言)训练 SA,并将其用于提取另一种语言(目标语言)音频片段的向量表征。我们发现,若源语言与目标语言相似,SA 仍能从目标语言的音频片段中捕捉语音结构。在基于样例查询的 STD 中,我们从大量源语言数据学习得到的 SA 中获取向量表征,发现这些表征优于从少量目标语言数据直接学习的朴素编码器和 SA 表征。结果表明,从高资源语言学习音频词向量模型并将其用于低资源语言是可行的,这进一步拓展了音频词向量的可用性。

关键词

引用

@article{arxiv.1707.06519,
  title  = {Language Transfer of Audio Word2Vec: Learning Audio Segment Representations without Target Language Data},
  author = {Chia-Hao Shen and Janet Y. Sung and Hung-Yi Lee},
  journal= {arXiv preprint arXiv:1707.06519},
  year   = {2018}
}

备注

arXiv admin note: text overlap with arXiv:1603.00982