基于跨域深度特征融合的视听数据鸟类物种分类
计算机视觉与模式识别
2018-11-27 v1
摘要
近十年来,随着深度卷积神经网络(CNN)的发展,许多图像分类与音频分类的先进算法取得了显著成功。然而,大多数工作仅利用单一类型的训练数据。本文研究了利用 CNN 结合视觉(图像)与音频(声音)数据对鸟类物种进行分类的问题,这一方向迄今鲜有探讨。具体而言,我们提出了基于 CNN 的多模态学习模型,采用三种融合策略(早期、中期、晚期)来解决跨域训练数据结合的问题。我们所提方法的优势在于:不仅可利用 CNN 从图像和音频数据(频谱图)中提取特征,还能跨模态组合这些特征。在实验中,我们在 CUB-200-2011 标准数据集上训练并评估网络结构,该数据集结合了我们针对相应数据物种自主采集的音频数据集。我们观察到,利用两种数据组合的模型优于仅使用任一种数据的模型。我们还表明,迁移学习可显著提升分类性能。
引用
@article{arxiv.1811.10199,
title = {Cross-domain Deep Feature Combination for Bird Species Classification with Audio-visual Data},
author = {Bold Naranchimeg and Chao Zhang and Takuya Akashi},
journal= {arXiv preprint arXiv:1811.10199},
year = {2018}
}