多模态分析:基于信息的内容估计与音频源分离
声音
2021-11-01 v3 数据库
信息检索
机器学习
音频与语音处理
摘要
本论文提出在音乐信号背景下研究多模态学习。通篇我们关注音频信号与文本信息之间的交互。在众多可使用的与音乐相关的文本来源中(例如评论、元数据或社交网络反馈),我们集中于歌词。歌声以独特的方式直接将音频信号与文本信息相连,将旋律与歌词结合,其中语言维度补充了乐器的抽象性。我们的研究聚焦于音频与歌词的交互,以面向源分离与基于信息的内容估计。
引用
@article{arxiv.2104.13276,
title = {MULTIMODAL ANALYSIS: Informed content estimation and audio source separation},
author = {Gabriel Meseguer-Brocal},
journal= {arXiv preprint arXiv:2104.13276},
year = {2021}
}
备注
Ph.D. dissertation. Thesis supervisor: Geoffroy Peeters. Jury:Laurent Girin, Ga\"el Richard, Rachel Bittner, Elena Cabrio, Bruno Gas, Perfecto Herrera Boyer, Antoine Liutkus