在语音到文本翻译中不要弃用固定窗口音频分割
计算与语言
2022-10-25 v1
摘要
对于实际应用而言,端到端语音语言翻译模型在连续音频上表现良好且无需依赖人工提供的分割至关重要。对于在线语音语言翻译,即模型需要在完整话语说出之前就开始翻译,大多数先前工作忽略了分割问题。在本文中,我们比较了在离线和在线设置下提高模型对分割错误鲁棒性的各种方法以及不同的分割策略,并报告了翻译质量、闪烁和延迟方面的的结果。我们在五个不同语言对上的发现表明,在适当条件下,简单的固定窗口音频分割可以表现得令人惊讶地好。
引用
@article{arxiv.2210.13363,
title = {Don't Discard Fixed-Window Audio Segmentation in Speech-to-Text Translation},
author = {Chantal Amrhein and Barry Haddow},
journal= {arXiv preprint arXiv:2210.13363},
year = {2022}
}
备注
accepted to WMT22