在低资源场景下利用翻译辅助语音转录
计算与语言
2018-06-12 v2
摘要
最近提出的濒危语言文档数据收集框架不仅旨在收集目标语言的语音,还旨在收集翻译成高资源语言的译文,从而使收集到的资源可解释。我们聚焦于这一场景,探索在极其低资源的设定下能否借助文本翻译来提高转录质量。我们提出了一个神经多源模型,并在三个低资源数据集上评估了其若干变体。我们发现,具有共享注意力的多源模型优于基线模型,将转录字符错误率最多降低了 12.3%。
引用
@article{arxiv.1803.08991,
title = {Leveraging translations for speech transcription in low-resource settings},
author = {Antonis Anastasopoulos and David Chiang},
journal= {arXiv preprint arXiv:1803.08991},
year = {2018}
}
备注
to be presented at Interspeech 2018