基于增强扩散学习的高保真可控生物声学生成
声音
2025-09-03 v1 音频与语音处理
摘要
生成式建模为生物声学提供了新机遇,能够合成逼真的动物发声,从而支持生物监测工作并补充濒危物种的稀缺数据。然而,直接从嘈杂的野外录音中生成鸟鸣波形仍然是一项重大挑战。我们提出了 BirdDiff,这是一种旨在从包含12种野生鸟类的嘈杂数据集中合成鸟鸣的生成式框架。该模型包含一个用于多尺度自适应鸟鸣增强的“零层”阶段,随后是一个以三种模态为条件的基于扩散的生成器:Mel 频率倒谱系数、物种标签和文本描述。增强阶段在最小化频谱失真的同时提高了信噪比(SNR),与三种广泛使用的非训练增强方法相比,实现了最高的 SNR 增益(+10.45 dB)和最低的 Itakura-Saito 距离(0.54)。我们将 BirdDiff 与基线生成模型 DiffWave 进行了比较评估。我们的方法在生成质量指标上取得了显著提升:Fréchet Audio Distance(从0.590降至0.213)、Jensen-Shannon Divergence(从0.259降至0.226)以及统计差异区间数(从7.33降至5.58)。为了评估物种特定细节的保留情况,我们使用在原始数据集上训练的 ResNet50 分类器来识别生成的样本。分类准确率从35.9%(DiffWave)提升至70.1%(BirdDiff),其中12个物种中有8个的准确率超过70%。这些结果表明,BirdDiff 能够直接从嘈杂的野外录音中实现高保真、可控的鸟鸣生成。
引用
@article{arxiv.2509.00318,
title = {Towards High-Fidelity and Controllable Bioacoustic Generation via Enhanced Diffusion Learning},
author = {Tianyu Song and Ton Viet Ta},
journal= {arXiv preprint arXiv:2509.00318},
year = {2025}
}