中文

RaDur:一种参考感知且时长鲁棒的目标声音检测网络

声音 2022-04-06 v1 音频与语音处理

摘要

目标声音检测(TSD)旨在给定参考信息的情况下从混合音频中检测目标声音。先前方法使用条件网络从参考音频中提取具有声音判别性的嵌入,再用其从混合音频中检测目标声音。然而,该网络在使用不同参考音频时表现差异很大(例如对含噪和短时长参考音频表现较差),且易对瞬态事件(即短于 11 秒)做出错误判断。为克服这些问题,本文提出一种用于 TSD 的参考感知且时长鲁棒的网络(RaDur)。更具体地,为使网络更感知参考信息,我们提出嵌入增强模块,在生成嵌入时考虑混合音频,并应用注意力池化增强与目标声音相关帧的特征、削弱噪声帧的特征。此外,提出一种时长鲁棒 focal loss 以帮助模型处理不同时长事件。为评估方法,我们基于 UrbanSound 和 Audioset 构建了两个 TSD 数据集。大量实验表明了方法的有效性。

关键词

引用

@article{arxiv.2204.02143,
  title  = {RaDur: A Reference-aware and Duration-robust Network for Target Sound Detection},
  author = {Dongchao Yang and Helin Wang and Zhongjie Ye and Yuexian Zou and Wenwu Wang},
  journal= {arXiv preprint arXiv:2204.02143},
  year   = {2022}
}

备注

submitted to interspeech2022