面向端到端语音翻译的表示净化
计算与语言
2024-12-06 v1 声音
音频与语音处理
摘要
语音到文本翻译(ST)是一种跨模态任务,涉及将 spoken language 转换为不同语言的文本。以往的研究主要致力于通过促进机器翻译知识传递来增强语音翻译,探索各种方法弥合语音与文本模态之间的差距。尽管取得了显著进展,但诸如音色和节奏等不相关于翻译内容的语音因素,往往限制了知识传递的效率。本文我们将语音表示概念化为内容无关因素与内容相关因素的组合。通过初步实验检验内容无关因素对翻译性能的影响,观察到当向语音信号引入内容无关扰动时,性能会显著下降。为此,我们提出了一种基于超级监督增强的语音表示净化(SRPSE)框架,以排除语音表示中内容无关的组成部分,从而缓解其对ST的负面影响。在MuST-C和CoVoST-2数据集上的实验表明,SRPSE在所有翻译方向上均显著提升了翻译性能,并在无转录物(transcript-free)设置下取得卓越成绩。
引用
@article{arxiv.2412.04266,
title = {Representation Purification for End-to-End Speech Translation},
author = {Chengwei Zhang and Yue Zhou and Rui Zhao and Yidong Chen and Xiaodong Shi},
journal= {arXiv preprint arXiv:2412.04266},
year = {2024}
}
备注
Accepted by COLING 2025