JEP-KD:基于联合嵌入预测架构的视觉语音识别知识蒸馏
计算机视觉与模式识别
2024-03-29 v1 计算与语言
机器学习
声音
音频与语音处理
摘要
由于在视觉上传达语义信息的固有局限性,视觉语音识别(VSR)任务通常被认为具有比自动语音识别(ASR)更低的理论性能上限。为了缓解这一挑战,本文引入了一种使用联合嵌入预测架构(JEPA)的先进知识蒸馏方法,命名为 JEP-KD,旨在在模型训练期间更有效地利用音频特征。JEP-KD 的核心是在嵌入层中包含一个生成网络,这增强了视频编码器的语义特征提取能力,并使其与来自预训练 ASR 模型编码器的音频特征更紧密地对齐。该方法旨在逐步缩小 VSR 和 ASR 之间的性能差距。此外,为 JEP-KD 框架建立了一套全面的多模态、多阶段训练方案,增强了训练过程的稳健性和有效性。实验结果表明,JEP-KD 显著提升了 VSR 模型的性能,并在不同的 VSR 平台上展现出通用性,表明其在其他多模态任务中具有更广泛的应用潜力。
引用
@article{arxiv.2403.18843,
title = {JEP-KD: Joint-Embedding Predictive Architecture Based Knowledge Distillation for Visual Speech Recognition},
author = {Chang Sun and Hong Yang and Bo Qin},
journal= {arXiv preprint arXiv:2403.18843},
year = {2024}
}