中文

端到端语音到文本翻译:综述

计算与语言 2024-06-11 v2 声音 音频与语音处理

摘要

语音到文本翻译涉及将一种语言的语音信号转换为另一种语言的文本的任务。它在各种领域都有应用,例如免提通信、听写、视频讲座转录和翻译等。自动语音识别(ASR)和机器翻译(MT)模型在传统的语音翻译中发挥着关键作用,能够将原始形式的口语转换为书面文本,并促进无缝的跨语言通信。ASR识别口语单词,而MT将转录的文本翻译成目标语言。这种分离式模型存在级联错误传播以及高资源和训练成本的问题。因此,研究人员一直在探索用于语音翻译的端到端(E2E)模型。然而,据我们所知,目前还没有对现有端到端语音翻译工作的全面综述。因此,本综述讨论了这一方向的工作。我们试图提供对语音翻译任务中使用的模型、指标和数据集的全面回顾,并给出挑战和未来研究方向的新见解。我们相信这篇综述将对从事语音翻译模型各种应用的研究人员有所帮助。

关键词

引用

@article{arxiv.2312.01053,
  title  = {End-to-End Speech-to-Text Translation: A Survey},
  author = {Nivedita Sethiya and Chandresh Kumar Maurya},
  journal= {arXiv preprint arXiv:2312.01053},
  year   = {2024}
}

备注

75 pages