跨越物种界限:从语音到动物声音的迁移学习
机器学习
2025-12-10 v1 人工智能
计算与语言
声音
摘要
自监督语音模型在语音处理中展现出了优异的性能,但其在非语音数据上的有效性仍有待探索。我们研究了此类模型在生物声学检测与分类任务上的迁移学习能力。结果表明,HuBERT、WavLM 和 XEUS 等模型能够跨分类单元生成动物声音的丰富潜在表示。我们通过对时间平均表示进行线性探针分析来研究模型属性。随后,我们将该方法扩展,结合其他下游架构以考量时间信息的影响。最后,我们研究了频率范围和噪声对性能的影响。值得注意的是,我们的结果与微调后的生物声学预训练模型具有竞争力,并展示了抗噪声预训练设置的影响。这些发现突显了基于语音的自监督学习作为推进生物声学研究有效框架的潜力。
引用
@article{arxiv.2509.04166,
title = {Crossing the Species Divide: Transfer Learning from Speech to Animal Sounds},
author = {Jules Cauzinille and Marius Miron and Olivier Pietquin and Masato Hagiwara and Ricard Marxer and Arnaud Rey and Benoit Favre},
journal= {arXiv preprint arXiv:2509.04166},
year = {2025}
}
备注
5 pages, 3 figures, uses dcase2025.sty, submitted to DCASE 2025