用于时频谱图中哨声提取的分阶段 GAN 学习
计算机视觉与模式识别
2023-04-07 v1 信号处理
摘要
哨声轮廓提取旨在从时频谱图中以折线形式导出动物哨声。对于齿鲸,哨声提取结果可作为分析动物丰度、物种身份及社会活动的基础。过去几十年间,随着长期记录系统变得可负担,人们提出了自动化哨声提取算法以处理大量记录数据。近来,一种基于深度学习的方法在多变噪声条件下提取哨声表现出优越性能。然而,训练此类网络需要大量劳动密集的标注,而许多物种并不具备此类数据。为克服该限制,我们提出一种分阶段生成对抗网络(GAN)框架,其通过三个阶段合成适用于深度模型训练的新哨声数据:谱图中背景噪声的生成、哨声轮廓的生成以及哨声信号的生成。通过分离样本中不同组件的生成,我们的框架即使在仅有少量专家标注数据时也能合成视觉上可信的哨声数据与标签。无论人工标注数据量多少,所提数据增强框架均使哨声提取模型性能得到一致提升,哨声提取平均 F1 分数最大提升 1.69。我们的分阶段 GAN 在利用增强数据改进哨声提取模型方面也优于单一 GAN。数据与代码将发布于 https://github.com/Paul-LiPu/CompositeGAN_WhistleAugment。
引用
@article{arxiv.2304.02714,
title = {Learning Stage-wise GANs for Whistle Extraction in Time-Frequency Spectrograms},
author = {Pu Li and Marie Roch and Holger Klinck and Erica Fleishman and Douglas Gillespie and Eva-Marie Nosal and Yu Shiu and Xiaobai Liu},
journal= {arXiv preprint arXiv:2304.02714},
year = {2023}
}
备注
Accepted by IEEE Transactions of Multimedia (2023)