中文

利用掩码自编码器学习狨猴发声模式以实现鲁棒的叫声分割、分类与呼叫者识别

声音 2025-08-13 v4 人工智能 音频与语音处理

摘要

狨猴是一种高度发声的灵长类动物,是研究社会-交流行为的关键模型。与人类语音不同,狨猴的发声较少结构化、高度可变,且在嘈杂、低资源条件下录制。学习狨猴交流需要联合进行叫声分割、分类和呼叫者识别——这些是具有挑战性的领域任务。先前的 CNN 处理局部模式但难以捕捉长程时序结构。我们使用自注意力机制的 Transformer 来建模全局依赖。然而,Transformer 在小规模、嘈杂的标注数据集上表现出过拟合和不稳定性。为解决这一问题,我们使用 MAE——一种从数百小时未标注狨猴录音中重建掩码片段的自监督方法——对 Transformer 进行预训练。预训练改善了稳定性和泛化能力。结果表明,经过 MAE 预训练的 Transformer 优于 CNN,证明了现代自监督架构能够有效建模低资源的非人类声音交流。

关键词

引用

@article{arxiv.2410.23279,
  title  = {Learning Marmoset Vocal Patterns with a Masked Autoencoder for Robust Call Segmentation, Classification, and Caller Identification},
  author = {Bin Wu and Shinnosuke Takamichi and Sakriani Sakti and Satoshi Nakamura},
  journal= {arXiv preprint arXiv:2410.23279},
  year   = {2025}
}

备注

Accepted by ASRU 2025