基于神经音频编解码语言模型的样本式乐器生成
音频与语音处理
2024-07-23 v1 机器学习
声音
摘要
本文提出并研究了利用神经音频编解码语言模型自动生成基于文本或参考音频提示的样本式乐器的方法。我们的方法扩展了一个生成音频框架,条件化于88键钢琴谱系上的音高、速度以及结合的文本/音频嵌入。我们发现维持生成乐器中 timbral(音色)一致性是一个主要挑战。为解决此问题,我们引入了三种不同的条件化方案。我们通过客观指标和人类听觉测试对方法进行分析,表明我们的 approach 能够产生引人注目的音乐乐器。具体而言,我们引入了新的客观指标来评估生成乐器的音色一致性,并改进了用于文本到乐器情境中平均 CLAP(对抗性语言-音频预训练)得分的度量,指出其直接应用不适用于评估此任务。我们的发现揭示了音色一致性、生成样本质量以及其与输入提示对应性之间的复杂相互作用。
引用
@article{arxiv.2407.15641,
title = {Generating Sample-Based Musical Instruments Using Neural Audio Codec Language Models},
author = {Shahan Nercessian and Johannes Imort and Ninon Devis and Frederik Blang},
journal= {arXiv preprint arXiv:2407.15641},
year = {2024}
}
备注
8 pages, 2 figures. Accepted to the 25th Conference of the International Society for Music Information Retrieval (ISMIR)