基于音频-文本模型的声音事件检测与异构时间标注
音频与语音处理
2025-08-29 v1
摘要
近期发展使得能够基于音频及相关元数据生成合成标题,允许将自然语言中包含的信息作为其他音频任务的输入。在本文中,我们提出一种新方法,用于自由形式文本指导声音事件检测系统。我们使用机器生成的标题作为强标签的补充信息进行训练,并使用不同类型的文本输入进行评估。此外,我们研究了只有部分训练数据具有强标签、其余数据仅具有时序弱标签的情形。我们的发现表明,合成标题在两种情况下都优于通常用于声音事件检测的 CRNN 架构。对于包含 50 个高度不平衡类别的数据集,PSDS-1 分数在使用强标签训练时从 0.223 提升至 0.277;在仅半数训练数据具有弱标签时,从 0.166 提升至 0.218。
引用
@article{arxiv.2508.20703,
title = {Sound event detection with audio-text models and heterogeneous temporal annotations},
author = {Manu Harju and Annamaria Mesaros},
journal= {arXiv preprint arXiv:2508.20703},
year = {2025}
}
备注
Accepted to IEEE Workshop on Applications of Signal Processing to Audio and Acoustics (WASPAA) 2025