中文

S-SONDO:用于通用音频基础模型的自监督知识蒸馏

人工智能 2026-04-29 v1 声音

摘要

通用音频基础模型近期取得了显著进展,实现了在多样化任务上的强大性能。然而,当前最先进的模型参数数量庞大,往往达数亿元,导致推理成本高昂,难以在边缘设备上部署。知识蒸馏是模型压缩的 proven 策略,但音频领域的先前工作大多聚焦于监督设置,依赖类别 logits、中间特征或特定于架构的技术。此类假设排除了仅输出嵌入的模型,如自监督或度量学习模型。我们引入 S-SONDO(Self-Supervised KnOwledge DistillatioN for General AuDio FOundation Models),首个仅依据输出嵌入对通用音频模型进行知识蒸馏的框架。通过避免对 logits 或层级对齐的需求,S-SONDO 具备架构中立性,可广泛应用于基于嵌入的教师模型。我们通过将两种音频基础模型蒸馏为三个高效学生模型,展示了其有效性,学生模型规模可缩小至教师模型的 1/61,同时保留最高 96% 的教师性能。我们也提供了关于损失函数选择和基于聚类的平衡数据抽样的实用见解。代码链接:https://github.com/MedAliAdlouni/ssondo。

关键词

引用

@article{arxiv.2604.24933,
  title  = {S-SONDO: Self-Supervised Knowledge Distillation for General Audio Foundation Models},
  author = {Mohammed Ali El Adlouni and Aurian Quelennec and Pierre Chouteau and Geoffroy Peeters and Slim Essid},
  journal= {arXiv preprint arXiv:2604.24933},
  year   = {2026}
}

备注

Accepted at IEEE ICASSP 2026. 5 pages, 2 figures, 3 tables. Equal contribution by first two authors. Code: https://github.com/MedAliAdlouni/ssondo | Models: https://huggingface.co/mohammedali2501/ssondo | Package: https://pypi.org/project/ssondo/