通过任务算术蒸馏语音和音乐编码器
声音
2025-05-20 v1 音频与语音处理
摘要
尽管自监督学习 (SSL) 在语音和音乐领域取得了进展,但现有方法将这些领域视为独立,从而限制了其统一音频理解的能力。对于需要通用表征的应用(如音频大型语言模型),构建统一模型是有利的。然而,直接训练语音和音乐的通用模型计算成本高昂。知识蒸馏的教师集 may 是一个自然解决方案,但我们认为,解耦语音和音乐SSL模型的蒸馏可以提供更大的灵活性。因此,我们提出学习蒸馏任务向量,然后线性插值它们以形成统一的语音+music模型。这种策略通过可调整的权重实现灵活的领域强调,也更容易训练。在语音和音乐基准测试上进行实验表明,我们的方法在整体性能方面优于集体蒸馏。
引用
@article{arxiv.2505.13270,
title = {Distilling a speech and music encoder with task arithmetic},
author = {Fabian Ritter-Gutierrez and Yi-Cheng Lin and Jui-Chiang Wei and Jeremy H. M Wong and Eng Siong Chng and Nancy F. Chen and Hung-yi Lee},
journal= {arXiv preprint arXiv:2505.13270},
year = {2025}
}
备注
Accepted at INTERSPEECH 2025