利用合成训练数据对大鼠超声 vocalizations 进行监督分类
声音
2024-01-22 v2 机器学习
音频与语音处理
摘要
鼠类啮齿动物产生的超声 vocalizations(USVs)频率可达约 120kHz。这些叫声在社会行为中十分重要,因此对其分析可揭示声音交流的功能及其失调机制。人工识别 USVs 并将其后续分类为不同子类十分耗时。尽管用于识别与分类的机器学习方法可带来巨大效率提升,但生成训练数据所需的时间和精力可能很高,且现有方法的准确性可能存在问题。在此,我们将一名受过训练的人类与两个卷积神经网络(CNNs)——DeepSqueak 和 VocalMat,在包含大鼠 USVs 的音频上的检测与分类性能进行比较。此外,我们测试了向 VocalMat CNN 的训练数据中插入合成 USVs 的效果,以此作为降低生成训练集工作量的手段。我们的结果表明,在叫声识别与分类指标上 VocalMat 优于 DeepSqueak CNN。另外,我们发现用合成图像扩充训练数据进一步提高了准确性,使其足够接近人类表现,从而允许该软件在实验室条件下使用。
引用
@article{arxiv.2303.03183,
title = {Utilizing synthetic training data for the supervised classification of rat ultrasonic vocalizations},
author = {K. Jack Scott and Lucinda J. Speers and David K. Bilkey},
journal= {arXiv preprint arXiv:2303.03183},
year = {2024}
}
备注
25 pages, 5 main figures, 2 tables