SSR:面向语音语言模型的准确感知模态连接器
计算与语言
2025-05-20 v2 声音
音频与语音处理
摘要
将语音融合到预训练语言模型 (SpeechLM) 通常会因语音长句编码不够高效以及对预训练文本模态的遗忘问题而受限. 我们提出了 SSR-Connector (分段语音表示连接器) 以实现更好的模态融合. 依据语音-文本对齐,我们的方法对语音特征进行分段和压缩,以匹配文本嵌入的粒度. 此外,我们引入了两阶段训练管道,包括蒸馏和微调阶段,以缓解遗忘问题. SSR-Connector 在语音-文本模态融合方面优于现有机制,始终在保持预训练文本能力的同时,实现了更好的语音理解(例如在 StoryCloze 上的准确率提升 +10,在 Speech-MMLU 上的准确率提升 +20).
引用
@article{arxiv.2410.00168,
title = {SSR: Alignment-Aware Modality Connector for Speech Language Models},
author = {Weiting Tan and Hirofumi Inaguma and Ning Dong and Paden Tomasello and Xutai Ma},
journal= {arXiv preprint arXiv:2410.00168},
year = {2025}
}
备注
IWSLT 2025