利用零样本多语言机器翻译技术应对语音翻译中的数据稀缺
计算与语言
2022-05-17 v1 声音
音频与语音处理
摘要
近来,端到端语音翻译(ST)因可避免错误传播而受到显著关注。然而,该方法受困于数据稀缺。它严重依赖直接的 ST 数据,且在利用语音转写与文本翻译数据(这类数据通常更易获取)方面效率较低。在相关的多语言文本翻译领域,已提出若干用于零样本翻译的技术。一个主要思想是增加不同语言中语义相似句子的相似度。我们通过构建在语音转写和文本翻译数据上训练的 ST 模型,考察这些思想能否应用于语音翻译。我们考察了数据增强与辅助损失函数的效果。这些技术被成功应用于使用有限 ST 数据的少样本 ST,与直接端到端 ST 相比最高提升 +12.9 BLEU 点,与从 ASR 模型微调的 ST 模型相比提升 +3.1 BLEU 点。
引用
@article{arxiv.2201.11172,
title = {Tackling data scarcity in speech translation using zero-shot multilingual machine translation techniques},
author = {Tu Anh Dinh and Danni Liu and Jan Niehues},
journal= {arXiv preprint arXiv:2201.11172},
year = {2022}
}
备注
6 pages, 5 figures, accepted to IEEE ICASSP 2022. arXiv admin note: text overlap with arXiv:2107.06010