众包数据中噪声对语音翻译的影响
计算与语言
2022-07-04 v2 人工智能
摘要
训练语音翻译(ST)模型需要大规模高质量数据集。MuST-C是应用最广泛的ST基准数据集之一。它包含八个翻译方向各约400小时的语音-转录-翻译数据。该数据集在创建过程中通过了若干质量控制过滤。然而,我们发现MuST-C仍存在三个主要质量问题:音文本错位、翻译不准确,以及不必要的说话人姓名。这些质量问题对模型开发与评估有何影响?本文以英德(En-De)翻译为例,提出一种自动修复或过滤上述质量问题的办法。我们的实验表明,ST模型在干净测试集上表现更好,且所提模型的排名在不同测试集上保持一致。此外,仅从训练集中移除错位数据点并不会带来更好的ST模型。
引用
@article{arxiv.2206.13756,
title = {On the Impact of Noises in Crowd-Sourced Data for Speech Translation},
author = {Siqi Ouyang and Rong Ye and Lei Li},
journal= {arXiv preprint arXiv:2206.13756},
year = {2022}
}
备注
Accepted to IWSLT 2022 as a scientific paper