面向低复杂度声学场景分类的自适应知识蒸馏:面向设备的教师模型
声音
2025-09-12 v1 人工智能
摘要
本技术报告描述了我们在 DCASE 2025 挑战任务 1(低复杂度设备稳健声学场景分类)中的提交方案。我们的工作解决了严格的复杂度约束和对seen与unseen设备的鲁棒泛化问题,同时也利用了新规则允许在测试时使用设备标签。我们提出的系统基于知识蒸馏框架,其中高效 CP-MobileNet 学生从紧凑的、专门化的两位教师集成中学习。该集成组合了基线 PaSST 教师(使用标准交叉熵训练)和一个“通用专家”教师。该专家使用我们新近提出的基于设备感知特征对齐(DAFA)损失训练,该损失改编自先前工作,显式地为设备鲁棒性构建特征空间。为了充分利用测试时设备标签的可用性,蒸馏后的学生模型随后经过最终的设备特定微调阶段。我们提出的系统在开发数据集上实现了最终准确率为 57.93%,在seen与unseen设备上均显著优于官方基线。
引用
@article{arxiv.2509.09262,
title = {Adaptive Knowledge Distillation using a Device-Aware Teacher for Low-Complexity Acoustic Scene Classification},
author = {Seung Gyu Jeong and Seong Eun Kim},
journal= {arXiv preprint arXiv:2509.09262},
year = {2025}
}