基于多尺度 CNN 的深度度量学习用于生物声学分类:利用动态三元组损失克服训练数据稀缺
音频与语音处理
2019-09-04 v2 机器学习
声音
摘要
本文提出了一种基于多尺度卷积神经网络(CNN)的深度度量学习方法,用于低训练数据条件下的生物声学分类。所提出的 CNN 的特点是在每一层利用四种不同尺寸的滤波器来分析输入特征图。这种多尺度特性有助于有效描述不同的生物声学事件:较小的滤波器有助于学习生物声学事件的更精细细节,而较大的滤波器有助于分析更大的上下文从而得到全局细节。在所提出的 CNN 架构中采用动态三元组损失来学习从输入空间到嵌入空间的变换,并在该嵌入空间中进行分类。三元组损失通过一次分析三个称为三元组的样本来学习该变换,其中类内距离被最小化,同时通过动态递增的间隔最大化类间分离。可能的三元组数量随数据集大小呈立方增长,使得在低训练数据条件下三元组损失比 softmax 交叉熵损失更合适。在三个不同的公开数据集上的实验表明,所提出的框架优于现有的生物声学分类框架。实验结果也证实了在低训练数据条件下三元组损失相对于交叉熵损失的优越性。
引用
@article{arxiv.1903.10713,
title = {Multiscale CNN based Deep Metric Learning for Bioacoustic Classification: Overcoming Training Data Scarcity Using Dynamic Triplet Loss},
author = {Anshul Thakur and Daksh Thapar and Padmanabhan Rajan and Aditya Nigam},
journal= {arXiv preprint arXiv:1903.10713},
year = {2019}
}
备注
Under Review at JASA. Primitive version of paper. We are still working on getting better performances out of the comparative methods