视觉作为中介语:学习未转写语音的多语言语义嵌入
计算与语言
2018-04-10 v1 声音
音频与语音处理
摘要
本文中,我们探索为自然图像与描述这些图像内容的语音波形学习神经网络嵌入。这些嵌入直接从波形中学习,无需语言转写或常规语音识别技术。先前工作已在英语语音数据的单语言情形下研究了该设定,而本工作是首次将此类技术应用于英语以外语言的尝试。利用以英语和印地语收集的口语描述,我们展示同一模型架构可成功应用于两种语言。进一步,我们证明同时在两种语言上训练多语言模型可较单语言模型获得更优性能。最后,我们展示这些模型能够执行语义跨语言语音到语音检索。
引用
@article{arxiv.1804.03052,
title = {Vision as an Interlingua: Learning Multilingual Semantic Embeddings of Untranscribed Speech},
author = {David Harwath and Galen Chuang and James Glass},
journal= {arXiv preprint arXiv:1804.03052},
year = {2018}
}
备注
to appear at ICASSP 2018