利用自相似性作为注意力生成具有结构的音乐
声音
2024-06-27 v2 机器学习
音频与语音处理
摘要
尽管深度学习和生成式 AI 取得了诸多创新,但在创建长期结构以及音乐作品中常见的多层重复结构方面仍是开放挑战。我们提出一种注意力层,使用新颖的方法将用户提供的自相似矩阵应用于前一时间步,并在我们提出的 Similarity Incentivized Neural Generator(SING)系统中进行演示,这是一个具有两层结构的深度学习自主音乐生成系统。第一层是普通的长短期记忆(LSTM)层,第二层是我们提出的注意力层。在生成过程中,这种注意力机制将模板音乐中建议的结构强加于生成的音乐。我们在 MAESTRO 数据集上训练 SING,使用一种新颖的可变批量方法,并将其性能与不含注意力机制的相同模型进行比较。我们提出的注意力机制的添加显著提高了网络复制特定结构的能力,并且在未见的测试集上性能优于不含注意力机制的模型。
关键词
引用
@article{arxiv.2406.15647,
title = {Generating Music with Structure Using Self-Similarity as Attention},
author = {Sophia Hager and Kathleen Hablutzel and Katherine M. Kinnaird},
journal= {arXiv preprint arXiv:2406.15647},
year = {2024}
}