中文

用于信号-符号双射翻译的跨模态变分推断

机器学习 2020-02-11 v1 机器学习

摘要

从信号中提取符号信息是活跃的研究领域,支撑着众多应用,尤其在音乐信息检索(MIR)领域。这一复杂任务还关联音高提取或乐器识别等其他主题,是一个催生了众多方法的高要求课题,这些方法大多基于先进的信号处理算法。然而,这些技术往往非通用,允许提取信号的确定物理性质(音高、八度),但不允许任意词汇表或更一般的标注。此外,这些技术是单侧的,意味着它们能从音频信号提取符号数据,但不能执行反向过程并实现符号到信号的生成。本文中,我们提出一种信号/符号翻译的双射方法,将该问题转化为信号与符号域上的密度估计任务,二者均视为相关的随机变量。我们用两个不同的变分自编码器估计此联合分布,每个域一个,其内在表示通过加性约束被迫匹配,使两个模型可分别学习与生成,同时允许信号到符号和符号到信号的推断。本文中,我们在音高、八度和力度符号上测试模型,这构成了迈向音乐转写和标签约束音频生成的基本一步。除通用性外,该系统在训练和生成时相当轻量,同时允许若干有趣的创造性用途,我们在文末概述。

关键词

引用

@article{arxiv.2002.03862,
  title  = {Cross-modal variational inference for bijective signal-symbol translation},
  author = {Axel Chemla--Romeu-Santos and Stavros Ntalampiras and Philippe Esling and Goffredo Haus and Gérard Assayag},
  journal= {arXiv preprint arXiv:2002.03862},
  year   = {2020}
}

备注

Proceedings of the 22nd International Conference on Digital Audio Effects (DAFx-2019)