中文

无需知识蒸馏的 CNN-GRU 声学场景分类模型

音频与语音处理 2025-09-15 v1

摘要

在本技术报告中,我们展示了 SNTL-NTU 团队为低复杂度声学场景与事件(DCASE)2025 挑战赛 Task 1 提交的方案。该方案偏离了典型的从教师模型到学生模型的知识蒸馏应用,旨在以有限的复杂度实现高性能。所提出的模型基于 CNN-GRU 模型,仅使用 TAU Urban Acoustic Scene 2022 Mobile 开发数据集进行训练,未使用任何外部数据集,但用于设备脉冲响应(DIR)数据增强的 MicIRP 除外。所提出的模型内存占用为 114.2KB,需要 10.9M 次乘加(MAC)运算。使用该开发数据集,所提出的模型达到了 60.25% 的准确率。

关键词

引用

@article{arxiv.2509.09931,
  title  = {Acoustic Scene Classification Using CNN-GRU Model Without Knowledge Distillation},
  author = {Ee-Leng Tan and Jun Wei Yeow and Santi Peksi and Haowen Li and Ziyi Yang and Woon-Seng Gan},
  journal= {arXiv preprint arXiv:2509.09931},
  year   = {2025}
}

备注

3 pages, 2 figures, 2 tables