中文

通过对抗样本生成增强无监督音频表征学习

声音 2023-03-16 v1 音频与语音处理

摘要

现有音频分析方法通常先将音频流变换为频谱图,再输入 CNN 进行进一步分析。标准 CNN 在特征图上识别特定视觉模式,然后池化得到高层表征,这忽略了所识别模式的位置信息。然而,与自然图像不同,音频频谱图的语义对位置变化敏感,因为其纵轴与横轴分别表示音频的频率与时间信息,而非朴素直角坐标。因此,CNN 对位置变化的不敏感性对音频频谱图编码起负面作用。为解决此问题,本文提出一种新的自监督学习机制,其通过先生成对抗样本(即负样本),再驱动 CNN 在潜空间中区分负样本对的嵌入来增强音频表征。大量实验表明,相较以往方法,所提方法在 9 个下游数据集上取得最佳或具竞争力的结果,验证了其在音频表征学习上的有效性。

关键词

引用

@article{arxiv.2303.08561,
  title  = {Enhancing Unsupervised Audio Representation Learning via Adversarial Sample Generation},
  author = {Yulin Pan and Xiangteng He and Biao Gong and Yuxin Peng and Yiliang Lv},
  journal= {arXiv preprint arXiv:2303.08561},
  year   = {2023}
}

备注

8 pages, 4 figures