SONAR:面向领域自适应音频表示的自蒸馏持续预训练
声音
2026-01-26 v2 音频与语音处理
摘要
在 AudioSet 等大规模数据集上的自监督学习(SSL)已成为音频表示学习的主流范式。尽管新无标注音频的不断涌入为丰富这些静态表示提供了机会,但一种朴素的方法是使用所有可用数据从头开始重新训练模型。然而,这种方法在计算上是不可行的,并且丢弃了先前训练的模型权重中蕴含的宝贵知识。为了解决这种低效问题,我们提出了 SONAR(面向领域自适应音频表示的自蒸馏持续预训练),这是一个建立在 BEATs 之上的持续预训练框架。SONAR 通过解决三个关键挑战,有效适应新领域的同时缓解了灾难性遗忘:实施针对新数据和先前数据的联合采样策略,应用正则化以平衡特异性和通用性,以及动态扩展分词器码本以适应新的声学模式。跨四个不同领域的实验表明,我们的方法实现了高适应性以及对遗忘的鲁棒抵抗。
引用
@article{arxiv.2509.15703,
title = {SONAR: Self-Distilled Continual Pre-training for Domain Adaptive Audio Representation},
author = {Yizhou Zhang and Yuan Gao and Wangjin Zhou and Zicheng Yuan and Keisuke Imoto and Tatsuya Kawahara},
journal= {arXiv preprint arXiv:2509.15703},
year = {2026}
}
备注
Accepted to ICASSP 2026