中文

无监督特征学习显著改进鸟类声音的大规模自动分类

声音 2014-07-14 v1 机器学习

摘要

基于声音的鸟类物种自动分类是生态学、保护监测和发声交流研究中日益重要的计算工具。为了使分类在实践中有用,关键在于提高其准确性,同时确保其能在大数据规模上运行。许多方法使用基于声谱图类型数据的声学测量,例如 Mel 频率倒谱系数 (MFCC) 特征,它代表了频谱信息的人工设计摘要。然而,最近的机器学习工作表明,从数据中自动学习的特征通常优于人工设计的特征变换。特征学习可以大规模且“无监督”地进行,意味着它不需要手动数据标注,却可以提高分类等“有监督”任务的性能。在这项工作中,我们引入了一种从大量鸟类声音记录中学习特征的技术,其灵感来源于在其他领域被证明有用的技术。我们使用随机森林分类器,在四个大型且多样的鸟类发声数据库上,实验比较了十二种源自 Mel 谱的不同特征表示(其中六种使用了该技术)。我们证明 MFCC 在此背景下能力有限,导致性能不如原始 Mel 谱数据。相反,我们证明无监督特征学习在不增加模型训练后计算复杂度的情况下,提供了相对于 MFCC 和 Mel 谱的显著提升。这种提升在大规模单标签分类任务中尤为显著。通过我们的过程学习到的时频激活类似于从鸟类初级听觉前脑计算出的时频感受野。

关键词

引用

@article{arxiv.1405.6524,
  title  = {Automatic large-scale classification of bird sounds is strongly improved by unsupervised feature learning},
  author = {Dan Stowell and Mark D. Plumbley},
  journal= {arXiv preprint arXiv:1405.6524},
  year   = {2014}
}