深度学习用于音乐生成:四种方法及其比较评估
声音
2025-04-04 v1 人工智能
音频与语音处理
摘要
本文介绍了四种不同的人工智能算法用于音乐生成,并旨在就这些方法在审美质量以及特定应用场景的适合性进行比较。首先,由轻微修改的视觉转换器神经网络用作语言模型生成的四组旋律。其次,由将聊天声学与经典转换器神经网络相结合生成的旋律(相同的音乐生成方法在先前的研究中给出)。第三组旋律由将谢希林节奏理论与经典转换器神经网络相结合生成。第四组旋律则使用由 OpenAI 提供的 GPT3 转换器生成。对这些方法生成的旋律进行比较分析,结果表明它们之间以及就审美价值而言存在显著差异,GPT3 生成的旋律审美价值最高,而新引入的谢希林方法相对于以前的声学方法生成的旋律质量更佳。
引用
@article{arxiv.2504.02586,
title = {Deep learning for music generation. Four approaches and their comparative evaluation},
author = {Razvan Paroiu and Stefan Trausan-Matu},
journal= {arXiv preprint arXiv:2504.02586},
year = {2025}
}