中文

基于CNN的判别训练用于帧级分类器声学事件检测中的域补偿

音频与语音处理 2021-03-29 v1 声音

摘要

域失配是声学事件检测任务中一个值得注意的问题,因为在大多数实际应用中目标域数据难以获取。在本研究中,我们提出一种新颖的基于 CNN 的判别训练框架作为域补偿方法来处理该问题。它使用并行的基于 CNN 的判别器来学习一对高层中间声学表示。结合二值判别损失,判别器被强制最大化利用每个含目标事件的音频片段中异质声学信息的判别性,从而产生鲁棒的成对表示,能够分别很好地判别目标事件与背景/域变化。此外,为了更好地学习目标事件的瞬态特征,设计了一个帧级分类器来执行最终分类。另外,进一步提出带基于 CNN 的判别器初始化的两阶段训练以增强系统训练。所有实验均在 DCASE 2018 Task3 数据集上执行。结果表明,在跨域条件下我们的方案在 AUC 上相对提升 1.812.11.8-12.1%,且在域内评估条件下无任何性能下降,显著优于官方基线。

关键词

引用

@article{arxiv.2103.14297,
  title  = {CNN-based Discriminative Training for Domain Compensation in Acoustic Event Detection with Frame-wise Classifier},
  author = {Tiantian Tang and Xinyuan Zhou and Yanhua Long and Yijie Li and Jiaen Liang},
  journal= {arXiv preprint arXiv:2103.14297},
  year   = {2021}
}