面向爪哇语、巽他语、巴厘语和巴塔克语语音识别与合成的跨语言机器语音链
计算与语言
2020-11-05 v1 声音
音频与语音处理
摘要
尽管印度尼西亚有七百多种民族语言,现有可支持原住民社区内部及村外人员交流的技术仍然有限。因此,原住民仍因文化障碍而面临隔离,语言持续消失。为加速交流,语音到语音翻译(S2ST)技术是克服语言障碍的一种途径。然而,S2ST 系统需要机器翻译(MT)、语音识别(ASR)与合成(TTS),它们严重依赖监督训练以及难以从民族社区收集的大量语言资源。近期提出的机器语音链机制可使 ASR 与 TTS 在半监督学习中相互辅助。该框架最初仅用于单语。本研究致力于为下列印尼民族语言开发语音识别与合成:爪哇语、巽他语、巴厘语和巴塔克语。我们首先在监督训练中分别训练标准印尼语的 ASR 与 TTS。随后,利用印尼语 ASR 与 TTS,在跨语言机器语音链框架中仅使用文本或仅使用语音数据来开发民族语言的 ASR 与 TTS,从而免去这些民族语言配对语音-文本数据的需求。
引用
@article{arxiv.2011.02128,
title = {Cross-Lingual Machine Speech Chain for Javanese, Sundanese, Balinese, and Bataks Speech Recognition and Synthesis},
author = {Sashi Novitasari and Andros Tjandra and Sakriani Sakti and Satoshi Nakamura},
journal= {arXiv preprint arXiv:2011.02128},
year = {2020}
}
备注
Accepted in SLTU-CCURL 2020