通过利用目标语言上下文增强端到端对话语音翻译
计算与语言
2023-09-28 v1 声音
音频与语音处理
摘要
引入更长上下文已被证明有益于机器翻译,但在端到端语音翻译(E2E-ST)中纳入上下文仍研究不足。为弥补这一差距,我们在 E2E-ST 中引入目标语言上下文,以增强连贯性并克服扩展音频片段的内存限制。此外,我们提出上下文丢弃(context dropout)以确保对上下文缺失的鲁棒性,并通过加入说话人信息进一步提升性能。我们提出的上下文感知 E2E-ST 优于基于孤立语句的 E2E-ST 方法。最后,我们证明在对话语音中,上下文信息主要有助于捕捉上下文风格,以及消解代词指代和命名实体。
引用
@article{arxiv.2309.15686,
title = {Enhancing End-to-End Conversational Speech Translation Through Target Language Context Utilization},
author = {Amir Hussein and Brian Yan and Antonios Anastasopoulos and Shinji Watanabe and Sanjeev Khudanpur},
journal= {arXiv preprint arXiv:2309.15686},
year = {2023}
}