面向低复杂度声学场景分类的联合特征与输出蒸馏
声音
2025-07-29 v1 音频与语音处理
摘要
本报告提出了一个具有多教师指导的双层知识蒸馏框架,用于 DCASE2025 任务 1 中的低复杂度声学场景分类 (ASC)。我们提出了一种联合迁移软 logits 和中间特征表示的蒸馏策略。具体而言,我们预训练了 PaSST 和 CP-ResNet 模型作为教师模型。来自教师的 logits 被平均以生成软目标,同时选取一个 CP-ResNet 用于特征级蒸馏。这使得紧凑的学生模型 (CP-Mobile) 能够从教师指导中捕获语义分布和结构信息。在 TAU Urban Acoustic Scenes 2022 Mobile 数据集(开发集)上的实验表明,我们提交的系统准确率高达 59.30%。
引用
@article{arxiv.2507.19557,
title = {Joint Feature and Output Distillation for Low-complexity Acoustic Scene Classification},
author = {Haowen Li and Ziyi Yang and Mou Wang and Ee-Leng Tan and Junwei Yeow and Santi Peksi and Woon-Seng Gan},
journal= {arXiv preprint arXiv:2507.19557},
year = {2025}
}
备注
4 pages, submitted to DCASE2025 Challenge Task 1