中文

面向低复杂度声学场景分类的联合特征与输出蒸馏

声音 2025-07-29 v1 音频与语音处理

摘要

本报告提出了一个具有多教师指导的双层知识蒸馏框架,用于 DCASE2025 任务 1 中的低复杂度声学场景分类 (ASC)。我们提出了一种联合迁移软 logits 和中间特征表示的蒸馏策略。具体而言,我们预训练了 PaSST 和 CP-ResNet 模型作为教师模型。来自教师的 logits 被平均以生成软目标,同时选取一个 CP-ResNet 用于特征级蒸馏。这使得紧凑的学生模型 (CP-Mobile) 能够从教师指导中捕获语义分布和结构信息。在 TAU Urban Acoustic Scenes 2022 Mobile 数据集(开发集)上的实验表明,我们提交的系统准确率高达 59.30%。

关键词

引用

@article{arxiv.2507.19557,
  title  = {Joint Feature and Output Distillation for Low-complexity Acoustic Scene Classification},
  author = {Haowen Li and Ziyi Yang and Mou Wang and Ee-Leng Tan and Junwei Yeow and Santi Peksi and Woon-Seng Gan},
  journal= {arXiv preprint arXiv:2507.19557},
  year   = {2025}
}

备注

4 pages, submitted to DCASE2025 Challenge Task 1