中文

基于教师引导的混淆类指令的数据高效声学场景分类

声音 2024-09-19 v1 机器学习 音频与语音处理

摘要

本技术报告描述了 SNTL-NTU 团队在 DCASE 2024 挑战任务 1(数据高效低复杂度声学场景分类)中的提交方案。我们引入了三个系统以应对不同规模的训练数据。对于小规模训练数据,我们通过减少基础通道数来降低提供基线模型的复杂度。我们采用 mixup 数据增强以增加训练样本的多样性。对于更大的训练数据,我们使用 FocusNet 为ensemble中多个 Patchout faSt Spectrogram Transformer (PaSST) 模型和基线模型(训练于 44.1 kHz 原始采样率)提供混淆类信息。我们使用知识蒸馏将 ensemble 模型蒸馏到基线学生模型。使用 TAU Urban Acoustic Scene 2022 Mobile 开发数据集训练后,三个系统在 split (100, 50, 25, 10, 5)% 上的平均测试准确率分别为 (62.21, 59.82, 56.81, 53.03, 47.97)%。

关键词

引用

@article{arxiv.2409.11964,
  title  = {Data Efficient Acoustic Scene Classification using Teacher-Informed Confusing Class Instruction},
  author = {Jin Jie Sean Yeo and Ee-Leng Tan and Jisheng Bai and Santi Peksi and Woon-Seng Gan},
  journal= {arXiv preprint arXiv:2409.11964},
  year   = {2024}
}

备注

5 pages, 3 figures