面向自然自动配音的语音合成中的语音拼写同步 (PS-TTS)
音频与语音处理
2026-05-05 v4 人工智能
摘要
最近,基于人工智能的配音技术取得了进展,使自动配音 (AD) 能够将视频中的源语音转换为不同语言的目标语音。然而,自然配音仍面临同步挑战,如时长和唇部同步 (lip-sync),这两者对于保持观众体验至关重要。因此,本文提出一种用于 AD 流程的同步方法,通过改写译文来实现同步,包括两个步骤:用于时长约束的等时化,以及用于保持唇部同步的语音拼写同步 (PS)。首先,通过改写译文实现等时化,确保目标语音时长与源语音时长匹配。其次,我们引入 PS,使用基于训练数据的元音距离的局部代价进行动态时间对齐 (DTW),以便目标文本由与源元音相似的元音组成。最后,我们将这种方法扩展到 PSComet,联合考虑语义相似性和语音相似性,以更好地保留含义。所提出的方法被集成到语音合成系统中,分别称为 PS-TTS 和 PS-Comet TTS。使用韩语和英语的唇读数据集以及一位语音演员的配音数据集进行性能评估,结果表明两种系统在多个客观指标上均优于不含 PS 的语音合成系统,并且在韩语到英语和英语到韩语配音中优于语音演员。我们将实验扩展到法语,测试这些语言之间的全部语言对,以评估跨语言适用性。在所有语言对中,PS-Comet 表现最佳,在保持唇部同步准确性与语义保留之间取得良好平衡,确认 PS-Comet 在语义保留方面比 PS 本身更准确地实现唇部同步。
引用
@article{arxiv.2604.09111,
title = {PS-TTS: Phonetic Synchronization in Text-to-Speech for Achieving Natural Automated Dubbing},
author = {Changi Hong and Yoonah Song and Hwayoung Park and Chaewoon Bang and Dayeon Ku and Do Hyun Lee and Hong Kook Kim},
journal= {arXiv preprint arXiv:2604.09111},
year = {2026}
}
备注
Accepted to ICPR 2026