应对训练与测试分割不匹配:FBK@IWSLT2021
计算与语言
2023-10-19 v2 声音
音频与语音处理
摘要
本文描述FBK提交至IWSLT 2021离线语音翻译任务的系统。我们采用直接模型参与,其为基于Transformer的架构,训练用于将英语语音音频数据翻译为德语文本。训练流程以知识蒸馏与两步微调过程为特征。知识蒸馏与第一步微调均在人工分割的真实与合成数据上执行,后者由在可用语料上训练的MT系统生成。不同的是,第二步微调在MuST-C v2 En-De数据集的随机分割上执行。其主要目标是减少当语音翻译模型在人工分割数据(即理想的类句子分割)上训练却在自动分割音频(即实际的更真实测试条件)上评估时出现的性能下降。出于同样目的,在将测试数据传入系统前,应用一种考虑音频内容(停顿)与所产生片段长度的自定义混合分割过程。在推理时,我们将此过程与基于语音活动检测(VAD)的基线分割方法比较。我们的结果表明所提混合方法的有效性,表现为与人工分割的差距从8.3 BLEU点缩小至1.4 BLEU点。
引用
@article{arxiv.2106.12607,
title = {Dealing with training and test segmentation mismatch: FBK@IWSLT2021},
author = {Sara Papi and Marco Gaido and Matteo Negri and Marco Turchi},
journal= {arXiv preprint arXiv:2106.12607},
year = {2023}
}
备注
Accepted at IWSLT2021