Persian MusicGen:面向波斯音乐的大规模数据集与文化感知生成模型
声音
2026-05-15 v1 计算与语言
摘要
波斯音乐以其独特的音调、调式系统(Dastgah)和节奏结构,对主要在西方音乐上训练的音乐生成模型提出了重大挑战。我们通过策划首个大规模波斯歌曲数据集来填补这一空白,该数据集包含超过 900 小时的高质量音频样本,涵盖流行、传统和当代风格等多种子流派。该数据集捕捉了波斯音乐丰富的旋律和文化多样性,并作为微调 MusicGen 这一 SOTA 音乐生成模型的基础。我们使 MusicGen 适应这一领域,并利用主观和客观指标评估其性能。为了评估生成音乐与预期风格标签之间的语义对齐,我们报告了在生成输出中准确反映的相关标签比例。我们的结果表明,微调后的模型产生的作品更符合波斯风格惯例。这项工作为生成式音乐研究引入了新资源,并展示了音乐生成模型对代表性不足的文化和语言语境的适应性。
引用
@article{arxiv.2605.14765,
title = {Persian MusicGen: A Large-Scale Dataset and Culturally-Aware Generative Model for Persian Music},
author = {Mohammad Hossein Sameti and Diba Hadi Esfangereh and Sepehr Harfi Moridani and Leili Javidpour and Mahdieh Soleymani Baghshah},
journal= {arXiv preprint arXiv:2605.14765},
year = {2026}
}
备注
9 pages, 2 figures, 3 tables