中文

端到端文本到语音模型的知识能否改进神经 MIDI 到音频合成系统?

声音 2023-03-22 v2 音频与语音处理

摘要

鉴于从符号输入进行音乐与语音合成的相似性以及文本到语音(TTS)技术的快速发展,借鉴 TTS 技术来改进 MIDI 到音频性能是值得探索的。在本研究中,我们分析了基于 TTS 的 MIDI 到音频系统的不足,并从特征计算、模型选择和训练策略方面对其进行改进,旨在合成高度自然的音频。此外,我们通过听感测试、音高测量和频谱图分析进行了广泛的模型评估。本工作不仅展示了高度自然音乐的合成,还为学界提供了透彻的分析方法和有益成果。我们的代码、预训练模型、补充材料和音频样本已在 https://github.com/nii-yamagishilab/midi-to-audio 开源。

关键词

引用

@article{arxiv.2211.13868,
  title  = {Can Knowledge of End-to-End Text-to-Speech Models Improve Neural MIDI-to-Audio Synthesis Systems?},
  author = {Xuan Shi and Erica Cooper and Xin Wang and Junichi Yamagishi and Shrikanth Narayanan},
  journal= {arXiv preprint arXiv:2211.13868},
  year   = {2023}
}

备注

Accepted by ICASSP 2023