X-OPD:面向语音 LLM 的跨模态单向蒸馏能力对齐
音频与语音处理
2026-03-31 v2 人工智能
计算与语言
摘要
从级联对话系统向端到端(E2E)语音大型语言模型(Speech LLM)的转变既改善了延迟,又增强了语音特征建模,但 E2E 模型常常在性能上显著落后于其文本版本。标准的监督微调(SFT)和强化学习(RL)训练方法难以缩小这一差距。为此,我们提出 X-OPD,即跨模态单向蒸馏(Cross-Modal On-Policy Distillation, X-OPD)框架,旨在系统性地对齐语音 LLM 与其文本版本的能力。X-OPD 使语音 LLM 能够通过单向 rollout 探索自身分布,文本基准教师模型对这些轨迹进行评估并提供逐 token 的反馈,有效地将教师模型的能力蒸馏到学生模型的多模态表征中。跨越多个基准的广泛实验表明,X-OPD 在复杂任务中显著缩小了与文本模型之间的差距,同时保留了模型自身的固有能力。
引用
@article{arxiv.2603.24596,
title = {X-OPD: Cross-Modal On-Policy Distillation for Capability Alignment in Speech LLMs},
author = {Di Cao and Dongjie Fu and Hai Yu and Siqi Zheng and Xu Tan and Tao Jin},
journal= {arXiv preprint arXiv:2603.24596},
year = {2026}
}
备注
Submitted to Interspeech 2026