基于音符位置感知注意力机制的歌声合成
音频与语音处理
2023-03-16 v2 机器学习
声音
信号处理
摘要
本文提出一种带有音符位置感知注意力机制的新颖序列到序列(seq2seq)模型,用于歌声合成(SVS)。能够同时执行声学与时序建模的 seq2seq 建模方法颇具吸引力。然而,由于歌声时序建模的困难,许多近期基于编码器-解码器模型的 SVS 系统仍依赖额外模块生成的显式时长信息。尽管一些研究使用带注意力机制的 seq2seq 模型进行同步建模,但它们对时序建模的鲁棒性不足。所提出的注意力机制旨在通过考虑乐谱给出的节奏来估计注意力权重。此外,还引入了若干技术以提升歌声的建模性能。实验结果表明,所提模型在自然度与时序鲁棒性方面均有效。
引用
@article{arxiv.2212.13703,
title = {Singing Voice Synthesis Based on a Musical Note Position-Aware Attention Mechanism},
author = {Yukiya Hono and Kei Hashimoto and Yoshihiko Nankaku and Keiichi Tokuda},
journal= {arXiv preprint arXiv:2212.13703},
year = {2023}
}
备注
5 pages, 4 figures, 2 tables, accepted to ICASSP 2023