中文

通过模型压缩与知识蒸馏实现高效语音翻译

计算与语言 2025-08-14 v2 声音 音频与语音处理

摘要

由于庞大的计算需求,高效部署大型音频语言模型进行语音翻译仍具挑战。本文通过向国际口语翻译大会 (IWSLT 2025) 的“模型压缩”赛道提交系统来应对这一挑战。我们尝试了多种方法的组合,包括基于层重要性评估的迭代层剪枝、4-bit 量化的低秩适配 (QLoRA) 以及知识蒸馏。在实验中,我们使用 Qwen2-Audio-7B-Instruct 进行德语和中文的语音翻译。我们剪枝后的(学生)模型在模型参数和存储占用上均实现了高达 50% 的减少,同时保留了领域内(教师)模型 97-100% 的翻译质量。

关键词

引用

@article{arxiv.2505.20237,
  title  = {Efficient Speech Translation through Model Compression and Knowledge Distillation},
  author = {Yasmin Moslem},
  journal= {arXiv preprint arXiv:2505.20237},
  year   = {2025}
}

备注

IWSLT 2025