中文

基于语音基础模型进行音视频表征学习的知识蒸馏

音频与语音处理 2025-02-11 v1 声音

摘要

音视频表征学习是推动多模态语音处理任务(如唇读、音视频语音识别)的关键技术。最近,语音基础模型(Speech Foundation Models, SFM)在 various speech-related tasks 上展现出卓越的泛化能力。基于这一进展,我们提出了一种利用 SFM 跨模态知识蒸馏的音视频表征学习模型。在我们的方法中,SFM 作为教师模型,通过干净音频输入提取多层隐藏表征。我们还引入了一种多教师集成方法,用于蒸馏接受音视频数据作为输入的学生模型。采用一种新颖的表征知识蒸馏损失函数进行预训练,以进一步提升下游任务的性能。我们的实验采用了自监督 SFM WavLM 和监督 SFM iFLYTEK-speech。结果表明,我们提出的方法在自动语音识别、视觉语音识别和音视频语音识别任务上达到或超过当前最先进基准的性能。此外,还进行了全面的消融研究和学习表征的可视化,以评估我们方法的有效性。

关键词

引用

@article{arxiv.2502.05766,
  title  = {Audio-Visual Representation Learning via Knowledge Distillation from Speech Foundation Models},
  author = {Jing-Xuan Zhang and Genshun Wan and Jianqing Gao and Zhen-Hua Ling},
  journal= {arXiv preprint arXiv:2502.05766},
  year   = {2025}
}

备注

accepted to Pattern Recognition