中文

用于神经音频数据处理的子谱归一化

声音 2021-03-26 v1 人工智能

摘要

卷积神经网络广泛应用于各类机器学习领域。在图像处理中,可通过将 2D 卷积应用于输入的所有空间维度来获取特征。然而在音频情形下,像梅尔谱图这样的频域输入在频率维度上具有不同且独特的特性。因此,需要一种方法使 2D 卷积层能以不同方式处理频率维度。本工作中,我们引入子谱归一化(SubSpectral Normalization, SSN),其将输入频率维度拆分为若干组(子带)并对每组执行不同的归一化。SSN 还包含可应用于每组的仿射变换。我们的方法在网络学习频率感知特性的同时消除了频率间偏转。在音频数据实验中,我们观察到 SSN 能有效提升网络性能。

关键词

引用

@article{arxiv.2103.13620,
  title  = {SubSpectral Normalization for Neural Audio Data Processing},
  author = {Simyung Chang and Hyoungwoo Park and Janghoon Cho and Hyunsin Park and Sungrack Yun and Kyuwoong Hwang},
  journal= {arXiv preprint arXiv:2103.13620},
  year   = {2021}
}

备注

4 pages, ICASSP '21 accepted