基于自监督解耦表示学习的鸟鸣嵌入提取
音频与语音处理
2024-12-31 v1 声音
信号处理
摘要
本文针对从整首鸟鸣水平提取鸟鸣嵌入,采用解耦表示学习(DRL)方法。鸟鸣嵌入是大规模生物声学任务中必需的资源,自监督方法如变分自编码器(VAE)在从鸟鸣片段(音符或字音水平)中提取低维嵌入方面已展现出良好性能。为扩展处理水平至整首鸟鸣而非切分为片段,本文将每个鸟鸣视为通用且判别性较强的部分,使用两个编码器学习这两个部分。本文根据聚类性能对所提方法在大鸲鸟数据集上进行评估,结果优于对比的预训练模型和基础VAE。最后,本文分析了嵌入中信息性部分的含义,进一步压缩其维度,并解释了解耦鸟鸣的性能。
引用
@article{arxiv.2412.20146,
title = {Bird Vocalization Embedding Extraction Using Self-Supervised Disentangled Representation Learning},
author = {Runwu Shi and Katsutoshi Itoyama and Kazuhiro Nakadai},
journal= {arXiv preprint arXiv:2412.20146},
year = {2024}
}
备注
Presented on Vocal Interactivity in-and-between Humans, Animals and Robots (VIHAR 2024), https://vihar-2024.vihar.org/assets/VIHAR_2024_proceedings.pdf