AlignSTS:基于跨模态对齐的语音到歌唱转换
音频与语音处理
2023-05-25 v4 计算与语言
多媒体
声音
摘要
语音到歌唱 (STS) 声音转换任务旨在生成与语音录音相对应的歌唱样本,同时面临一大挑战:在无文本情况下,目标(歌唱)音高轮廓与源(语音)内容之间的对齐难以学习。本文提出 AlignSTS,一种基于显式跨模态对齐的 STS 模型,其将音高和内容等语音方差视为不同模态。受人类如何将歌词唱入旋律的机制启发,AlignSTS:1) 采用一种新颖的节奏适配器来预测目标节奏表示,以弥合内容与音高之间的模态鸿沟,其中节奏表示以简单而有效的方式计算并被量化至离散空间;2) 使用预测的节奏表示基于交叉注意力对内容重新对齐,并进行跨模态融合以重新合成。大量实验表明,AlignSTS 在客观与主观指标上均取得优越性能。音频样本见 https://alignsts.github.io。
引用
@article{arxiv.2305.04476,
title = {AlignSTS: Speech-to-Singing Conversion via Cross-Modal Alignment},
author = {Ruiqi Li and Rongjie Huang and Lichao Zhang and Jinglin Liu and Zhou Zhao},
journal= {arXiv preprint arXiv:2305.04476},
year = {2023}
}
备注
Findings of ACL 2023