用于鲁棒音频表示学习的深度类内协方差分析
机器学习
2018-12-03 v2 人工智能
声音
音频与语音处理
摘要
卷积神经网络 (CNNs) 能够学习有效的特征,但已被证明当数据分布从训练数据变化到测试数据时会出现性能下降。在本文中,我们分析了 CNN 的内部表示,并观察到与训练数据的表示相比,每个类别中未见数据在 CNN 的嵌入空间中散布得更开(具有更高的方差)。更重要的是,如果未见数据来自偏移分布,这种差异会更加极端。基于这一观察,我们通过 CNN 内部表示的类内协方差的特征值分解客观地评估了每个类别中表示方差的程度,并观察到相同的行为。这可能会有问题,因为更大的方差可能导致样本跨越其类别的决策边界从而造成误分类。我们在表示上应用最近邻分类,并凭经验表明具有高方差的嵌入实际上具有显著更差的 KNN 分类性能,尽管从其端到端分类结果中无法预见这一点。为解决此问题,我们提出了深度类内协方差分析 (DWCCA),一种显著减少 DNN 表示的类内协方差的深度神经网络层,从而提升来自偏移分布的未见测试数据上的性能。我们在两个用于声学场景分类的数据集 (DCASE2016 和 DCASE2017) 上经验性地评估了 DWCCA。我们证明 DWCCA 不仅显著改善了网络的内部表示,还提高了端到端的分类准确率,尤其是在测试集表现出分布偏移时。通过在 VGG 网络上添加 DWCCA,我们在分布不匹配的情况下实现了约 6 个百分点的改进。
引用
@article{arxiv.1711.04022,
title = {Deep Within-Class Covariance Analysis for Robust Audio Representation Learning},
author = {Hamid Eghbal-zadeh and Matthias Dorfer and Gerhard Widmer},
journal= {arXiv preprint arXiv:1711.04022},
year = {2018}
}
备注
11 pages, 3 tables, 4 figures