中文

RCT:用于半监督声音事件检测的随机一致性训练

音频与语音处理 2024-01-01 v3 机器学习 声音

摘要

声音事件检测(SED)作为声学环境分析的核心模块,受到数据匮乏问题的困扰。半监督学习(SSL)的引入在很大程度上缓解了此类问题,且不带来额外的标注开销。本文研究 SSL 的几个核心模块,并引入一种随机一致性训练(RCT)策略。首先,提出一种自一致性损失与教师-学生模型融合以稳定训练。其次,提出一种硬 mixup 数据增强以考虑声音的可加性。第三,应用一种随机增强方案灵活组合不同类型的数据增强。实验表明,所提策略优于其他广泛使用的策略。

关键词

引用

@article{arxiv.2110.11144,
  title  = {RCT: Random Consistency Training for Semi-supervised Sound Event Detection},
  author = {Nian Shao and Erfan Loweimi and Xiaofei Li},
  journal= {arXiv preprint arXiv:2110.11144},
  year   = {2024}
}

备注

Preprint for interspeech 2022