基于图像的自动化物种识别:虚拟数据增强能否克服采样不足的问题?
计算机视觉与模式识别
2020-10-20 v1
摘要
自动化物种识别与界定具有挑战性,尤其在稀有且因此往往采样稀少的物种中,这无法充分区分种内与种间变异。由种间形态分化过低或过高所引起的典型问题,最好通过机器学习自动化方法来解决,这些方法从训练样本中学习高效且有效的物种识别。然而,有限的种内采样仍是机器学习中的关键挑战。在本研究中,我们评估了一种两级数据增强方法是否有助于克服自动化视觉物种识别中训练数据稀缺的问题。第一级视觉数据增强应用经典的数据增强方法以及使用GAN方法生成伪造图像。描述性特征向量源自VGG-16卷积神经网络(CNN)的瓶颈特征,随后使用全局平均池化和PCA逐步降维以防止过拟合。第二级数据增强通过在向量空间中采用过采样算法(SMOTE)在特征空间中进行合成额外采样。应用于两个具有挑战性的金龟子(鞘翅目)数据集,我们的增强方法优于未增强的深度学习基线方法以及传统的2D形态测量方法(普氏分析)。
引用
@article{arxiv.2010.09009,
title = {Image-based Automated Species Identification: Can Virtual Data Augmentation Overcome Problems of Insufficient Sampling?},
author = {Morris Klasen and Dirk Ahrens and Jonas Eberle and Volker Steinhage},
journal= {arXiv preprint arXiv:2010.09009},
year = {2020}
}