基于双向注意力机制的联合多尺度跨语言说话风格迁移用于自动配音
声音
2024-07-08 v2 音频与语音处理
摘要
自动配音可生成输入语音的另一种语言对应版本,可广泛应用于视频与游戏本地化等许多真实场景。除了合成翻译文本外,自动配音还需将源语言的说话风格迁移至配音语音中,使观众产生角色以其母语说话的印象。然而,当前最先进的自动配音系统仅对时长和语速进行迁移建模,忽略了情感、语调与重音等说话风格的其他方面,而这些对于完整塑造角色与语音理解同样至关重要。本文提出一种联合多尺度跨语言说话风格迁移框架,在全局(即语句级)与局部(即词级)尺度上同时建模语言间的双向说话风格迁移。每种语言的全局与局部说话风格被提取,并借助为每个方向设计的编码器-解码器框架以及两方向共享的双向注意力机制,来预测另一语言的全局与局部说话风格。随后采用多尺度说话风格增强的 FastSpeech 2 将预测的全局与局部说话风格合成为各语言的语音。实验结果证明了我们所提框架的有效性,在客观与主观评测中均优于仅含时长迁移的基线系统。
引用
@article{arxiv.2305.05203,
title = {Joint Multi-scale Cross-lingual Speaking Style Transfer with Bidirectional Attention Mechanism for Automatic Dubbing},
author = {Jingbei Li and Sipan Li and Ping Chen and Luwen Zhang and Yi Meng and Zhiyong Wu and Helen Meng and Qiao Tian and Yuping Wang and Yuxuan Wang},
journal= {arXiv preprint arXiv:2305.05203},
year = {2024}
}
备注
TASLP