中文

MusCaps:为音乐音频生成描述文本

声音 2021-12-09 v1 计算与语言 机器学习 音频与语音处理

摘要

基于内容的音乐信息检索随着深度学习的采用取得了快速进展。当前高层次音乐描述方法通常使用分类模型,如自动标注或流派与情绪分类。本工作中,我们提出通过音频描述(audio captioning)来处理音乐描述,其定义为以类人方式生成音乐音频内容的自然语言描述。为此,我们提出了首个音乐音频描述模型 MusCaps,由带时间注意力的编码器-解码器组成。我们的方法结合卷积与循环神经网络架构,通过多模态编码器联合处理音频-文本输入,并利用音频数据上的预训练获得能有效捕获并概括输入中音乐特征的表示。通过自动指标对生成描述文本的评估表明,我们的方法优于为非音乐音频描述设计的基线。通过消融研究,我们揭示该性能提升主要归因于音频编码器的预训练,而其他设计选择——模态融合、解码策略与注意力的使用——仅贡献边际。我们的模型代表了从基于分类的音乐描述向结合需听觉与语言理解任务的转变,以弥合音乐信息检索中的语义鸿沟。

关键词

引用

@article{arxiv.2104.11984,
  title  = {MusCaps: Generating Captions for Music Audio},
  author = {Ilaria Manco and Emmanouil Benetos and Elio Quinton and Gyorgy Fazekas},
  journal= {arXiv preprint arXiv:2104.11984},
  year   = {2021}
}

备注

Accepted to IJCNN 2021 for the Special Session on Representation Learning for Audio, Speech, and Music Processing