中文

致力于利用动物鸣叫序列结构

机器学习 2025-11-14 v1

摘要

动物鸣叫包含携带重要交流信息的序列结构,但大多数计算生物声学研究在时间轴上对提取的帧级特征进行平均处理,丢弃了单个鸣叫内部子单元的顺序信息。本文探讨了通过向量量化和Gumbel-Softmax向量量化对提取的自监督语音模型表示进行离散化后,是否可以有效捕获和利用时序信息。为此,HuBERT嵌入生成的标记序列的两两距离分析显示,它们可以区分四个生物声学数据集中的鸣叫类型和鸣叫者。使用k近邻和Levenshtein距离进行序列分类实验表明,向量量化的标记序列产生了相当的鸣叫类型和鸣叫者分类性能,展现了作为利用动物鸣叫序列信息的替代特征表示的潜力。

关键词

引用

@article{arxiv.2511.10190,
  title  = {Towards Leveraging Sequential Structure in Animal Vocalizations},
  author = {Eklavya Sarkar and Mathew Magimai. -Doss},
  journal= {arXiv preprint arXiv:2511.10190},
  year   = {2025}
}

备注

Accepted at NeurIPS workshop (AI for Non-Human Animal Communication)