面向离屏自动配音的韵律对齐
计算与语言
2022-04-07 v1 机器学习
声音
音频与语音处理
摘要
自动配音的目标是在实现视听一致性的同时进行语音到语音的翻译。这需要满足等时性,即通过匹配原始语音的韵律结构(包括短语与停顿)来进行翻译,尤其在说话者嘴部可见时。在先前工作中,我们引入了韵律对齐模型以解决等时或屏上配音问题。在本工作中,我们将韵律对齐模型扩展至同样处理离屏配音,其同步约束要求较宽松。我们在四个配音方向(英语到法语、意大利语、德语和西班牙语)上,基于公开可用的 TED 演讲集和公开可用的 YouTube 视频进行了实验。实证结果表明,相较于先前工作,扩展后的韵律对齐模型在分别将屏上和离屏自动配音应用于说话者嘴部可见与不可见的句子时,能显著提供更优的主观观看体验。
引用
@article{arxiv.2204.02530,
title = {Prosodic Alignment for off-screen automatic dubbing},
author = {Yogesh Virkar and Marcello Federico and Robert Enyedi and Roberto Barra-Chicote},
journal= {arXiv preprint arXiv:2204.02530},
year = {2022}
}
备注
5 pages, 2 figures, 3 tables, Submitted to Interspeech 2022