中文

多模态分析:基于信息的内容估计与音频源分离

声音 2021-11-01 v3 数据库 信息检索 机器学习 音频与语音处理

摘要

本论文提出在音乐信号背景下研究多模态学习。通篇我们关注音频信号与文本信息之间的交互。在众多可使用的与音乐相关的文本来源中(例如评论、元数据或社交网络反馈),我们集中于歌词。歌声以独特的方式直接将音频信号与文本信息相连,将旋律与歌词结合,其中语言维度补充了乐器的抽象性。我们的研究聚焦于音频与歌词的交互,以面向源分离与基于信息的内容估计。

关键词

引用

@article{arxiv.2104.13276,
  title  = {MULTIMODAL ANALYSIS: Informed content estimation and audio source separation},
  author = {Gabriel Meseguer-Brocal},
  journal= {arXiv preprint arXiv:2104.13276},
  year   = {2021}
}

备注

Ph.D. dissertation. Thesis supervisor: Geoffroy Peeters. Jury:Laurent Girin, Ga\"el Richard, Rachel Bittner, Elena Cabrio, Bruno Gas, Perfecto Herrera Boyer, Antoine Liutkus