语音翻译方法综述——声学方言解码器
计算与语言
2016-12-01 v1 神经与进化计算
声音
机器学习
摘要
语音翻译一直是指提供源文本或音频输入,并等待系统以所需形式给出翻译输出。在本文中,我们提出了声学方言解码器——一种语音到语音的耳戴式翻译设备。我们介绍并调研了语音工程领域的最新进展,以应用于 ADD,特别聚焦于识别、翻译和合成这三个主要处理步骤。我们通过设计用于源音频到文本的识别单元、用于源语言文本到目标语言文本的翻译单元,以及用于目标语言文本到目标语言语音的合成单元,来解决机器对自然语言理解的问题。周围环境的语音将由耳戴设备上的识别单元录制,并在成功读取一句话后立即开始翻译。这样,我们希望在输入被读取的同时给出翻译输出。识别单元将使用基于隐马尔可夫模型的工具包(HTK)、带有门控记忆单元的混合 RNN 系统,而合成单元将使用基于 HMM 的语音合成系统 HTS。该系统最初将构建为英语到泰米尔语的翻译设备。
引用
@article{arxiv.1610.03934,
title = {A Survey of Voice Translation Methodologies - Acoustic Dialect Decoder},
author = {Hans Krupakar and Keerthika Rajvel and Bharathi B and Angel Deborah S and Vallidevi Krishnamurthy},
journal= {arXiv preprint arXiv:1610.03934},
year = {2016}
}
备注
(8 pages, 7 figures, IEEE Digital Xplore paper)