从语音和音乐表示模型多级蒸馏
音频与语音处理
2025-06-12 v2
摘要
现实世界中的音频常混合语音和音乐,但模型通常只处理一个领域。本文引入了一种多教师蒸馏框架,将语音和音乐模型统一到单个模型中,同时显著减少模型大小。我们的方法利用领域特定教师模型的优势,例如 HuBERT 用于语音和 MERT 用于音乐,并探索了多种策略来平衡两个领域。跨各种任务的实验表明,我们的模型在性能上与领域特定模型相当,显示现跨域蒸馏的有效性。此外,我们进行了 few-shot 学习实验,凸显了在标注数据有限的现实场景中通用模型的必要性。我们的结果表明,该模型不仅在专用模型上表现一致,而且在 few-shot 场景中超越它们,证明了针对有限数据且任务多样的场景,跨域方法是必需且有效的。
引用
@article{arxiv.2506.07237,
title = {Multi-Distillation from Speech and Music Representation Models},
author = {Jui-Chiang Wei and Yi-Cheng Lin and Fabian Ritter-Gutierrez and Hung-yi Lee},
journal= {arXiv preprint arXiv:2506.07237},
year = {2025}
}
备注
8 pages, 1 figures