基于帧间距离损失以合成数据学习通用特征表示的弱监督声音事件检测
声音
2020-11-03 v1 音频与语音处理
摘要
由于强标注声音事件检测数据集的局限,利用合成数据提升声音事件检测系统性能已成为新的研究焦点。本文中,我们试图挖掘合成数据的使用以改进特征表示。基于度量学习,我们提出了用于域适应的帧间距离损失函数,并证明了其在声音事件检测上的有效性。我们也应用了基于合成数据的多任务学习。我们发现当两种方法结合使用时可取得最佳性能。在DCASE 2018 task 4测试集与DCASE 2019 task 4合成集上的实验均展示了具竞争力的结果。
引用
@article{arxiv.2011.00695,
title = {Learning generic feature representation with synthetic data for weakly-supervised sound event detection by inter-frame distance loss},
author = {Yuxin Huang and Liwei Lin and Xiangdong Wang and Hong Liu and Yueliang Qian and Min Liu and Kazushige Ouchi},
journal= {arXiv preprint arXiv:2011.00695},
year = {2020}
}