中文

AlignSTS:基于跨模态对齐的语音到歌唱转换

音频与语音处理 2023-05-25 v4 计算与语言 多媒体 声音

摘要

语音到歌唱 (STS) 声音转换任务旨在生成与语音录音相对应的歌唱样本,同时面临一大挑战:在无文本情况下,目标(歌唱)音高轮廓与源(语音)内容之间的对齐难以学习。本文提出 AlignSTS,一种基于显式跨模态对齐的 STS 模型,其将音高和内容等语音方差视为不同模态。受人类如何将歌词唱入旋律的机制启发,AlignSTS:1) 采用一种新颖的节奏适配器来预测目标节奏表示,以弥合内容与音高之间的模态鸿沟,其中节奏表示以简单而有效的方式计算并被量化至离散空间;2) 使用预测的节奏表示基于交叉注意力对内容重新对齐,并进行跨模态融合以重新合成。大量实验表明,AlignSTS 在客观与主观指标上均取得优越性能。音频样本见 https://alignsts.github.io。

关键词

引用

@article{arxiv.2305.04476,
  title  = {AlignSTS: Speech-to-Singing Conversion via Cross-Modal Alignment},
  author = {Ruiqi Li and Rongjie Huang and Lichao Zhang and Jinglin Liu and Zhou Zhao},
  journal= {arXiv preprint arXiv:2305.04476},
  year   = {2023}
}

备注

Findings of ACL 2023