用于具有可控质量-延迟权衡的同步语音翻译的增量分块束搜索
计算与语言
2023-09-21 v1 人工智能
声音
音频与语音处理
摘要
分块自注意力编码器模型近来已成为同步语音翻译的一种有前景的端到端方法。这些模型采用带假设可靠性评分的分块束搜索,以决定在继续翻译前何时等待更多语音输入。然而,该方法在整个语音输入被消耗前一直维持多个假设——此方案无法直接向用户展示单一的增量翻译。此外,该方法缺乏控制质量与延迟之间权衡的机制。我们提出一种改进的增量分块束搜索,引入局部一致或hold-策略以实现质量-延迟控制。我们将该框架应用于为在线或离线翻译训练的模型,并证明两类模型均可在在线模式下有效使用。在MuST-C上的实验结果显示,在不改变延迟的情况下BLEU提升0.6-3.6,或在不改变质量的情况下延迟降低0.8-1.4 s。
引用
@article{arxiv.2309.11379,
title = {Incremental Blockwise Beam Search for Simultaneous Speech Translation with Controllable Quality-Latency Tradeoff},
author = {Peter Polák and Brian Yan and Shinji Watanabe and Alex Waibel and Ondřej Bojar},
journal= {arXiv preprint arXiv:2309.11379},
year = {2023}
}
备注
Accepted at INTERSPEECH 2023