中文

利用时间戳信息改进目标声音提取

声音 2022-04-05 v1 音频与语音处理

摘要

目标声音提取(TSE)旨在从包含多个声音事件的混合音频中提取目标声音事件类的声音部分。以往工作主要关注弱标注数据、联合学习与新类别等问题,然而无人关注目标声音事件的起止时间,而这在听觉场景分析中已被强调。本文研究利用此类时间戳信息,通过目标声音检测网络与目标加权时频损失函数来帮助提取目标声音。更具体地,我们使用目标声音检测(TSD)网络的检测结果作为附加信息以引导目标声音提取网络的学习。我们还发现 TSE 的结果可进一步提升 TSD 网络的性能,从而提出目标声音检测与提取的互学习框架。此外,设计了一种目标加权时频损失函数,以在训练期间更多关注目标声音的时间区域。在由 Freesound Datasets 生成的合成数据上的实验结果表明,我们所提方法能显著改善 TSE 性能。

关键词

引用

@article{arxiv.2204.00821,
  title  = {Improving Target Sound Extraction with Timestamp Information},
  author = {Helin Wang and Dongchao Yang and Chao Weng and Jianwei Yu and Yuexian Zou},
  journal= {arXiv preprint arXiv:2204.00821},
  year   = {2022}
}

备注

submitted to interspeech2022