在干净数据上微调用于端到端语音翻译:FBK @ IWSLT 2018
音频与语音处理
2018-10-18 v1 计算与语言
机器学习
声音
机器学习
摘要
本文描述了 FBK 在 IWSLT 2018 端到端英德语音翻译任务上的提交系统。我们的系统依赖于基于 LSTM 和 CNN 的先进模型,其中 CNN 用于降低音频输入的时间维度,该维度通常远高于机器翻译输入。我们的模型仅使用为该任务发布的音频到文本平行数据进行训练,并在原始训练语料的清洗子集上进行了微调。权重归一化与标签平滑的加入在验证集上使基线系统提升了 1.0 个 BLEU 点。最终提交系统还采用了训练过程中的检查点平均以及多次训练所得模型的集成解码。在测试数据上,我们最佳的单模型取得了 9.7 的 BLEU 分数,而集成模型取得了 10.24 的 BLEU 分数。
引用
@article{arxiv.1810.07652,
title = {Fine-tuning on Clean Data for End-to-End Speech Translation: FBK @ IWSLT 2018},
author = {Mattia Antonino Di Gangi and Roberto Dessì and Roldano Cattoni and Matteo Negri and Marco Turchi},
journal= {arXiv preprint arXiv:1810.07652},
year = {2018}
}
备注
6 pages, 2 figures, system description at the 15th International Workshop on Spoken Language Translation (IWSLT) 2018