中文

Futga:通过时空增强生成式数据增强实现细粒度音乐理解

声音 2024-07-31 v1 人工智能 机器学习 音频与语音处理

摘要

现有音乐描述方法局限于生成短音乐片段的简洁全局描述,无法捕捉细粒度的音乐特征和时序音乐变化。为此,我们提出 FUTGA(Fined-grained Understanding through Temporally-enhanced Generative Augmentation),通过学习生成式数据增强实现细粒度音乐理解能力。我们利用现有的音乐描述数据集和大语言模型(LLM)合成包含结构描述和时间边界的细粒度音乐描述,用于完整曲目。经由所提出的合成数据集增强,FUTGA 能够识别音乐在关键转换点上的时序变化及其音乐功能,并为每个音乐片段生成详细描述。我们进一步引入由 FUTGA 生成的完整音乐描述数据集,作为 MusicCaps 和 Song Describer 数据集的增强。我们评估了自动生成的描述在多个下游任务中的质量,包括音乐生成和检索。实验表明,该方法生成的描述质量良好,显著提升了在各种下游任务中的性能。我们的代码和数据集可在 \href{https://huggingface.co/JoshuaW1997/FUTGA}{\textcolor{blue}{https://huggingface.co/JoshuaW1997/FUTGA}} 找到。

关键词

引用

@article{arxiv.2407.20445,
  title  = {Futga: Towards Fine-grained Music Understanding through Temporally-enhanced Generative Augmentation},
  author = {Junda Wu and Zachary Novack and Amit Namburi and Jiaheng Dai and Hao-Wen Dong and Zhouhang Xie and Carol Chen and Julian McAuley},
  journal= {arXiv preprint arXiv:2407.20445},
  year   = {2024}
}

备注

6 pages