中文

利用检索与示例方法优化直接语音翻译中的罕见词准确率

计算与语言 2024-10-02 v2

摘要

直接语音翻译(ST)模型常常难以处理罕见词。这些词的错误翻译可能产生严重后果,影响翻译质量和用户信任。虽然由于学习信号稀疏,罕见词翻译对神经模型而言本质上具有挑战性,但现实场景通常允许访问类似主题的过往录音翻译。为了利用这些宝贵资源,我们提出了一种检索与示例方法,以提升直接 ST 模型中的罕见词翻译准确率。首先,我们调整现有的 ST 模型,使其能够融入检索到的示例进行罕见词翻译,这让模型能像上下文学习一样从前置示例中获益。随后,我们开发了一个跨模态(语音到语音、语音到文本、文本到文本)检索器来定位合适的示例。我们证明,标准 ST 模型可以有效调整以利用示例进行罕见词翻译,与基线相比,使用黄金示例时罕见词翻译准确率提高了 17.6%,使用检索示例时提高了 8.5%。此外,我们的语音到语音检索方法优于其他模态,并对未见过的说话人表现出更高的鲁棒性。我们的代码已公开(https://github.com/SiqiLii/Retrieve-and-Demonstration-ST)。

关键词

引用

@article{arxiv.2409.09009,
  title  = {Optimizing Rare Word Accuracy in Direct Speech Translation with a Retrieval-and-Demonstration Approach},
  author = {Siqi Li and Danni Liu and Jan Niehues},
  journal= {arXiv preprint arXiv:2409.09009},
  year   = {2024}
}

备注

EMNLP 2024