中文

关于灵长类动物鸣叫通信的特征表示

音频与语音处理 2025-04-22 v1

摘要

灵长类动物鸣叫的声学分析常用于理解人类语言的演化起源。当前分析主要以人工或半人工方式进行。因此,亟需发展自动鸣叫分析方法。就此方向而言,研究受限于数据量小或针对特定情景开发分析方法,此外缺乏关于不同鸣叫分析任务相关信息类型的先验知识。为此,作为第一步,本文探讨了不同特征表示方法,包括基于 HCTSA 的手工特征 Catch22、来自在人类语音上训练的自监督学习 (SSL) 基于神经网络提取的特征,以及用于鸣叫类型分类、叫者识别和叫者性别识别的端到端声学建模。通过对三个不同灵长类鸣叫数据集进行调查,我们证明了 SSL 基于特征表示和端到端声学建模在鸣叫类型和叫者分类中优于 Catch22 特征。此外,我们还强调了信号带宽对获得任务性能的影响。

关键词

引用

@article{arxiv.2504.14981,
  title  = {On feature representations for marmoset vocal communication analysis},
  author = {Eklavya Sarkar and Kaja Wierucka and Alexandra B. Bosshard and Judith Burkart and Mathew Magimai. -Doss},
  journal= {arXiv preprint arXiv:2504.14981},
  year   = {2025}
}