通过语音条件 LLM 集成的混合专家提升代码切换 ASR
声音
2024-11-01 v2 人工智能
音频与语音处理
摘要
本文介绍了一种集成语音条件大型语言模型(LLM)并采用混合专家(MoE)架构的 connector,以解决自动语音识别(ASR)中的代码切换(CS)挑战。具体而言,我们提出了一种用于增强 LLM 文本生成能力向语音识别任务迁移的插入与删除中断标记(IDIT)机制。我们还 presented 一种基于 MoE 架构的 connector,该架构高效地管理多语言。为进一步增强多个专家的协作并利用 LLM 的理解能力,我们提出了两阶段渐进式训练策略:1)解冻 connector 并使用语言专用专家进行训练,将语音表示映射到文本空间。2)在提出的 IDIT 机制下训练 connector 和 LLM LoRA 适配器,激活所有专家以学习通用表示。实验结果表明,我们的方法显著优于包括端到端模型和大规模音频语言模型在内的状态最佳模型。
引用
@article{arxiv.2409.15905,
title = {Boosting Code-Switching ASR with Mixture of Experts Enhanced Speech-Conditioned LLM},
author = {Fengrun Zhang and Wang Geng and Hukai Huang and Yahui Shan and Cheng Yi and He Qu},
journal= {arXiv preprint arXiv:2409.15905},
year = {2024}
}
备注
Submitted to ICASSP 2025