中文

检测你所想:目标声音检测

声音 2022-07-08 v2 音频与语音处理

摘要

人类能够通过选择性听觉注意从多源混合信号中感知目标声音类型,然而此类功能在机器听觉中几乎未被探索。本文探讨目标声音检测(TSD)任务,旨在给定目标声音参考音频时,从混合音频中检测出目标声音信号。我们提出一种新颖的目标声音检测网络(TSDNet),其由两个主要部分构成:一个条件网络,用于生成表示目标声音的声音判别性条件嵌入向量;一个检测网络,以混合音频与条件嵌入向量为输入,产生目标声音的检测结果。这两个网络可通过多任务学习方法联合优化以进一步提升性能。此外,我们研究了强监督与弱监督两种策略来训练 TSDNet,并提出了一种通过混合两个样本的数据增强方法。为推进该研究,我们基于 URBAN-SED 与 UrbanSound8K 数据集构建了目标声音检测数据集(即 URBAN-TSD),实验结果表明我们的方法在强标注与弱标注数据上分别取得了 76.3% 与 56.8% 的基于片段的 F 分数。

关键词

引用

@article{arxiv.2112.10153,
  title  = {Detect what you want: Target Sound Detection},
  author = {Dongchao Yang and Helin Wang and Yuexian Zou and Fan Cui and Yujun Wang},
  journal= {arXiv preprint arXiv:2112.10153},
  year   = {2022}
}

备注

Submitted to DCASE workshop2022