中文

利用带软标签的教师-学生学习进行声学场景分类

音频与语音处理 2019-07-18 v2 声音

摘要

声学场景分类利用频谱信息将输入片段识别为预定义类别之一。由于不同类别间存在共同的声学属性(例如机场和购物中心均包含嘈杂人声),声学场景的频谱信息可能并非互斥。然而,基于独热标签的传统训练流程未考虑不同声学场景之间的相似性。我们利用教师-学生学习以推导考虑不同声学场景间共同声学属性的软标签。在教师-学生学习中,教师网络生成软标签,学生网络基于该软标签进行训练。我们研究了多种提取能更好表征不同场景间相似性的软标签的方法。此类尝试包括从定义为同一声学场景的多个音频片段中提取软标签。实验结果表明了我们方法的潜力,在 DCASE 2018 任务 1 验证集上取得了 77.36% 的分类准确率。

关键词

引用

@article{arxiv.1904.10135,
  title  = {Acoustic scene classification using teacher-student learning with soft-labels},
  author = {Hee-Soo Heo and Jee-weon Jung and Hye-jin Shim and Ha-Jin Yu},
  journal= {arXiv preprint arXiv:1904.10135},
  year   = {2019}
}

备注

Accepted for presentation at Interspeech 2019