中文

学习用于音频不变表示的复基函数

声音 2019-07-16 v1 计算机视觉与模式识别 机器学习 音频与语音处理

摘要

在许多机器学习任务中,从数据中学习特征已被证明比使用手工设计的特征更为成功。在音乐信息检索(MIR)中,从加窗频谱图中学习的特征对移调或时间平移等变换具有高度变异性。当这些变异性与相应的 MIR 任务无关时,它们是不理想的。我们提出了一种称为复自编码器(CAE)的架构,该架构学习对正交变换不变的特征。将信号映射到由 CAE 学习的复基函数上,会产生一个变换不变的“幅度空间”和一个变换相关的“相位空间”。相位空间可用于推断数据对之间的变换。在利用幅度空间的不变性属性时,我们在音频到乐谱对齐和音频重复段落发现任务中取得了最先进的结果。CAE 的 PyTorch 实现(包括重复段落发现方法)已在线提供。

关键词

引用

@article{arxiv.1907.05982,
  title  = {Learning Complex Basis Functions for Invariant Representations of Audio},
  author = {Stefan Lattner and Monika Dörfler and Andreas Arzt},
  journal= {arXiv preprint arXiv:1907.05982},
  year   = {2019}
}

备注

Paper accepted at the 20th International Society for Music Information Retrieval Conference, ISMIR 2019, Delft, The Netherlands, November 4-8; 8 pages, 4 figures, 4 tables