中文

面向音乐检索中音频与歌词的深度跨模态相关性学习

信息检索 2017-11-30 v2 声音 音频与语音处理

摘要

极少研究关注跨模态相关性学习,其中考虑了音频与歌词等不同数据模态的时间结构。源于音乐天然具有时间结构的特性,我们旨在学习音频与歌词间的深度序列相关性。本文提出一种深度跨模态相关性学习架构,包含用于音频模态与文本模态(歌词)的双分支深度神经网络。不同模态数据被转换至同一典型空间,其中利用模态间典型相关分析作为目标函数来计算时间结构的相似度。这是首项通过深度架构理解语言与音乐音频间相关性以学习音频与歌词配对时间相关性的研究。采用预训练 Doc2vec 模型接全连接层(全连接深度神经网络)来表示歌词。在音频分支上有两项重要贡献:i)研究了预训练 CNN 接全连接层来表示音乐音频;ii)我们进一步提出一种端到端架构,同时训练卷积层与全连接层以更好地学习音乐音频的时间结构。特别地,我们的端到端深度架构具有两个特性:同时实现特征学习与跨模态相关性学习,以及考虑时间结构学习联合表示。使用音频检索歌词或使用歌词检索音频的实验结果,验证了所提深度相关性学习架构在跨模态音乐检索中的有效性。

关键词

引用

@article{arxiv.1711.08976,
  title  = {Deep Cross-Modal Correlation Learning for Audio and Lyrics in Music Retrieval},
  author = {Yi Yu and Suhua Tang and Francisco Raposo and Lei Chen},
  journal= {arXiv preprint arXiv:1711.08976},
  year   = {2017}
}