软离散化音频表示以桥接模态差距:基于 LLM 的自动语音识别
音频与语音处理
2025-11-20 v2
摘要
将语音输入集成到大语言模型(LLM)的一个挑战源于音频数据是连续的,而 LLM 是离散 token 基础范式之间的差异。为缓解这一差距,我们提出了一种将向量量化(VQ)集成到 LLM 基于自动语音识别(ASR)中的方法。通过将 LLM 嵌入表作为 VQ 码本,VQ 模块将音频编码器的连续表示与离散 LLM 输入对齐,使 LLM 能够在更能反映语言结构的离散音频表示上运行。我们进一步通过更新码本并对码本嵌入执行加权求和,创建音频表示的软“离散化”。实验结果表明,我们提出的方法在 LLM 基于 ASR 的基线之上显著提升,特别是在跨域条件下表现更佳。这一工作突显了软离散化作为 LLM 基于 ASR 中模态桥接的潜力。
引用
@article{arxiv.2506.05706,
title = {Bridging the Modality Gap: Softly Discretizing Audio Representation for LLM-based Automatic Speech Recognition},
author = {Mu Yang and Szu-Jui Chen and Jiamin Xie and John Hansen},
journal= {arXiv preprint arXiv:2506.05706},
year = {2025}
}
备注
ASRU 2025