中文

SonicVerse:面向音乐特征导向的多任务caption生成

声音 2025-06-19 v1 人工智能 计算与语言 多媒体 音频与语音处理

摘要

能够准确反映音乐作品特征的详细描述可丰富音乐数据库并推动音乐 AI 研究的进展。本文介绍了一种多任务音乐caption模型 SonicVerse,将caption 生成与关键音乐特征检测任务(如调性检测、人声检测等)集成在一起,以直接捕获低层声学细节以及高层音乐属性。关键贡献是一种基于投影的架构,将音频输入转换为语言 token,同时通过专用辅助头检测音乐特征。这些头的输出也被投影到语言 token,以增强caption 的输入。该框架不仅为短音频片段生成丰富、描述性的caption,还能通过链式调用输出来直接生成更长音乐作品的详细、时间导向的描述。为训练该模型,我们扩展了 MusicBench 数据集,通过 MIRFLEX—a 模块化音乐特征提取器—为其标注音乐特征, resulting in 配对的音频、caption 和音乐特征数据。实验结果表明,按此方式融合特征可提高生成caption 的质量和细节。

关键词

引用

@article{arxiv.2506.15154,
  title  = {SonicVerse: Multi-Task Learning for Music Feature-Informed Captioning},
  author = {Anuradha Chopra and Abhinaba Roy and Dorien Herremans},
  journal= {arXiv preprint arXiv:2506.15154},
  year   = {2025}
}

备注

14 pages, 2 figures, Accepted to AIMC 2025