中文

一种用于生成塔布拉鼓音乐的新型 Bi-LSTM 与 Transformer 架构

声音 2024-04-10 v1 人工智能 音频与语音处理

摘要

引言:音乐生成是一项复杂的任务,近年来受到广泛关注,深度学习技术在该领域展现出了可喜的成果。目的:尽管在生成钢琴和其他西方音乐方面已有大量工作,但由于机器编码格式的印度音乐稀缺,关于生成古典印度音乐的研究有限。在本技术论文中,提出了生成古典印度音乐(特别是塔布拉鼓音乐)的方法。本文首先探索了使用深度学习架构生成钢琴音乐,随后将这些基础扩展至生成塔布拉鼓音乐。方法:使用 Python 中的 librosa 库对波形格式的塔布拉鼓音乐文件进行预处理。在提取的特征和标签上训练了一种带注意力机制的新型 Bi-LSTM 和 Transformer 模型。结果:随后使用这些模型预测塔布拉鼓音乐的下一个序列。Bi-LSTM 模型实现了 4.042 的损失和 1.0814 的 MAE。在 Transformer 模型中,塔布拉鼓音乐生成的损失和 MAE 分别为 55.9278 和 3.5173。结论:生成的音乐体现了新颖性与熟悉感的和谐融合,将音乐创作的边界推向了新的高度。

关键词

引用

@article{arxiv.2404.05765,
  title  = {A Novel Bi-LSTM And Transformer Architecture For Generating Tabla Music},
  author = {Roopa Mayya and Vivekanand Venkataraman and Anwesh P R and Narayana Darapaneni},
  journal= {arXiv preprint arXiv:2404.05765},
  year   = {2024}
}