DB3V:鸟鸣方言主导的鸟类鸣叫数据集用于跨语料鸟种识别
音频与语音处理
2024-06-14 v1 声音
摘要
在鸟类学研究中,人们广泛认识到鸟类在不同地区的鸣叫会呈现出多样化的方言。因此,仅通过鸣叫识别鸟种的计算方法面临着显著挑战。越来越多的人关注鸟种特定方言对鸟种识别方法有效性的影响。尽管通过扩大方言数据集可以缓解这一问题,但目前缺乏公开可用的测试数据,阻碍了稳健的基准测试工作。本文提出了鸟鸣方言数据集(Dialect Dominated Dataset of Bird Vocalisation),这是第一个专注于鸟鸣方言的跨语料数据集。DB3V包含来自美国陆地连续区(CONUS)三个不同地区的10种鸟类超过25小时的音频录音。除了呈现该数据集外,我们进行了分析并为跨语料鸟类识别建立了基线模型。该数据和代码已公开在线提供:https://zenodo.org/records/11544734
引用
@article{arxiv.2406.08517,
title = {DB3V: A Dialect Dominated Dataset of Bird Vocalisation for Cross-corpus Bird Species Recognition},
author = {Xin Jing and Luyang Zhang and Jiangjian Xie and Alexander Gebhard and Alice Baird and Bjoern Schuller},
journal= {arXiv preprint arXiv:2406.08517},
year = {2024}
}
备注
accepted by Interspeech 2024