面向长篇幅同声语音翻译的重新翻译策略
计算与语言
2020-04-09 v2 人工智能
机器学习
摘要
我们研究长篇幅语音内容的同声机器翻译问题。我们面向连续的语音到文本场景,为实时音频流(如讲座或实况解说)生成翻译字幕。由于该场景允许对我们的增量翻译进行修订,我们采用一种重新翻译(re-translation)方法进行同声翻译,即随着源语增长从其头开始反复翻译。该方法天然具有极低的延迟和较高的最终质量,但代价是随着输出持续精炼而带来的增量不稳定性。我们使用工业级语音识别与翻译工具组成的流水线进行实验,并辅以简单的推理启发式方法以改善稳定性。我们使用 TED 演讲作为多语言测试数据来源,在英语到德语的口语翻译上开发我们的技术。这种极简的同声翻译方法使我们能够轻松将最终评估扩展到另外六种目标语言,显著改善了所有语言的增量稳定性。
引用
@article{arxiv.1912.03393,
title = {Re-Translation Strategies For Long Form, Simultaneous, Spoken Language Translation},
author = {Naveen Arivazhagan and Colin Cherry and Te I and Wolfgang Macherey and Pallavi Baljekar and George Foster},
journal= {arXiv preprint arXiv:1912.03393},
year = {2020}
}
备注
ICASSP 2020