面向音频 LLM 的英汉双语代码切换语音识别的直接偏好优化
计算与语言
2026-05-26 v1 声音
摘要
音频大型语言模型(Audio LLMs)在转录代码切换语音时表现出系统性失效,尽管具备强大的多语言能力。我们聚焦英汉双语,识别出三类失效模式:语言遗漏、翻译取代转录、幻觉。我们应用直接偏好优化(DPO)对模型进行对齐,构建偏好对,其中被选响应保留混合语言内容,而被拒绝响应模仿失效模式。对三个 Audio LLM 在 10 万对(570 小时)上训练,我们观察到行为发生了一致的变化:模型学习在要求转录时保留语言组成,而非翻译。这种对齐导致不在分布内样本的 MER 降低最高达 89.6%(在分布内)和 20.0%(不在分布内)。我们的发现表明,DPO 可有效地从多语言 Audio LLM 中激发出正确的代码切换转录行为。
引用
@article{arxiv.2605.23975,
title = {Direct Preference Optimization for English-Mandarin Code-Switching Speech Recognition in Audio LLMs},
author = {Trung Nguyen Quang and Cheng Yi Lewis Won and Minh Duc Pham and Yingxu He and Shuo Sun and Ai Ti Aw},
journal= {arXiv preprint arXiv:2605.23975},
year = {2026}
}