中文

使用音素计数比率奖励强化学习的等长神经机器翻译

计算与语言 2024-03-26 v1 机器学习 音频与语音处理

摘要

传统的自动视频配音(AVD)流程包含三个关键模块,即自动语音识别(ASR)、神经机器翻译(NMT)和文本转语音(TTS)。在AVD流程中,采用等长NMT算法来调节合成输出文本的长度。这是为了保证配音后视频和音频对齐的同步性。以往的方法侧重于对齐机器翻译模型源语言和目标语言文本中的字符和单词数量。然而,我们的方法旨在对齐音素数量,因为音素与语音时长密切相关。在本文中,我们介绍了使用强化学习(RL)开发的等长NMT系统,重点优化源语言和目标语言句子对中音素计数的对齐。为了评估我们的模型,我们提出了音素计数合规性(PCC)得分,这是长度合规性的度量。我们的方法在应用于英语-印地语语言对时,与最先进模型相比,PCC得分提高了约36%。此外,我们在RL方法框架内提出了一种师生架构,以在音素计数和翻译质量之间保持权衡。

关键词

引用

@article{arxiv.2403.15469,
  title  = {Isometric Neural Machine Translation using Phoneme Count Ratio Reward-based Reinforcement Learning},
  author = {Shivam Ratnakant Mhaskar and Nirmesh J. Shah and Mohammadi Zaki and Ashishkumar P. Gudmalwar and Pankaj Wasnik and Rajiv Ratn Shah},
  journal= {arXiv preprint arXiv:2403.15469},
  year   = {2024}
}

备注

Accepted in NAACL2024 Findings