歌唱合成:借注意力之助
音频与语音处理
2020-05-07 v2 计算与语言
机器学习
声音
摘要
我们提出 UTACO,一种基于注意力序列到序列机制与基于扩张因果卷积声码器的歌唱合成模型。这两类模型已显著影响文本到语音领域,却从未被彻底应用于歌唱合成任务。UTACO 证明注意力可成功应用于歌唱合成领域,并相较最先进水平提升了自然度。与文献中先前模型相比,该系统显著减少了对 F0 模式、颤音及音符与音素时长等语音特征的显式建模。尽管如此,它相对先前神经歌唱合成模型展现出自然度的强劲提升。该模型无需任何时长或音高模式作为输入,并依据音乐上下文自主学习插入颤音。然而我们观察到,完全摒弃任何显式时长建模后,更难获得精确匹配歌曲节奏所需的精细时序控制。
引用
@article{arxiv.1912.05881,
title = {Singing Synthesis: with a little help from my attention},
author = {Orazio Angelini and Alexis Moinet and Kayoko Yanagisawa and Thomas Drugman},
journal= {arXiv preprint arXiv:1912.05881},
year = {2020}
}
备注
Submitted to Interspeech 2020