论语音与音频基础模型在缭果鸟叫声分析中的实用性
声音
2024-07-25 v2 机器学习
音频与语音处理
摘要
缭果鸟的叫声编码着关键信息,作为人类声音通信演化起源的神经生物学模型。传统上使用信号处理特征进行分析,最近的做法利用在人类语音上预训练的自监督模型进行特征提取,利用其独立于声学域的学习信号内在结构的能力。然而,这些基础模型在缭果鸟叫声分析中在多类别分类、带宽和预训练域方面的实用性尚不明确。本研究评估了来自语音和通用音频域的特征表示,这些特征在4、8和16 kHz的预训练带宽下,用于缭果鸟叫声类型和叫声者分类任务。结果表明,带宽更高的模型性能更好,语音或通用音频的预训练结果相当,均优于光谱基线。
引用
@article{arxiv.2407.16417,
title = {On the Utility of Speech and Audio Foundation Models for Marmoset Call Analysis},
author = {Eklavya Sarkar and Mathew Magimai. -Doss},
journal= {arXiv preprint arXiv:2407.16417},
year = {2024}
}
备注
Accepted at Interspeech 2024 satellite event (VIHAR 2024)