面向视频配音的长度感知语音翻译
计算与语言
2025-06-03 v1 人工智能
声音
音频与语音处理
摘要
在视频配音中,将翻译后的音频与源音频对齐是一项重大挑战。我们的重点是高效实现这一目标,专为实时、设备端视频配音场景量身定制。我们开发了一个基于音素的端到端长度敏感语音翻译(LSST)模型,该模型使用预定义标签生成长度不同的翻译——短、正常和长。此外,我们引入了长度感知束搜索(LABS),这是一种在单次解码过程中生成不同长度翻译的高效方法。与不具备长度感知的基线相比,该方法保持了可比的 BLEU 分数,同时显著增强了源音频与目标音频之间的同步质量,在西班牙语和韩语上分别实现了 0.34 和 0.65 的平均意见分(MOS)提升。
引用
@article{arxiv.2506.00740,
title = {Length Aware Speech Translation for Video Dubbing},
author = {Harveen Singh Chadha and Aswin Shanmugam Subramanian and Vikas Joshi and Shubham Bansal and Jian Xue and Rupeshkumar Mehta and Jinyu Li},
journal= {arXiv preprint arXiv:2506.00740},
year = {2025}
}
备注
This paper was accepted to Interspeech 2025