BLSP-KD: 通过知识蒸馏引导语言-语音预训练
计算与语言
2024-05-30 v1 声音
音频与语音处理
摘要
最近的端到端方法在将大型语言模型(LLM)扩展到语音输入方面显示出前景,但在直接评估和优化对齐质量方面存在局限性,并且由于语音-文本长度不匹配而无法实现细粒度对齐。我们提出了BLSP-KD,一种通过知识蒸馏引导语言-语音预训练的新方法,通过两项关键技术解决了这些局限性。首先,它通过知识蒸馏最小化LLM对语音和文本输入的下一个词预测分布之间的差异,从而优化语音-文本对齐。其次,它采用连续积分-触发策略将语音分割成与文本标记一一对应的标记,从而实现细粒度对齐。我们还引入了Partial LoRA (PLoRA),一种新的适应方法,支持在知识蒸馏下对LLM进行语音输入微调。定量评估表明,BLSP-KD在参数规模相当的情况下优于之前的端到端基线和级联系统,促进了LLM在语音输入下的通用指令跟随能力。该方法为将LLM扩展到口语交互提供了新的可能性。
引用
@article{arxiv.2405.19041,
title = {BLSP-KD: Bootstrapping Language-Speech Pre-training via Knowledge Distillation},
author = {Chen Wang and Minpeng Liao and Zhongqiang Huang and Jiajun Zhang},
journal= {arXiv preprint arXiv:2405.19041},
year = {2024}
}