从预言者到带噪声上下文:消除语音-LLM 中的上下文暴露偏差
计算与语言
2026-03-26 v1 人工智能
摘要
带语音-LLM 的情境自动语音识别(ASR)通常使用预言式对话历史进行训练,但在推理时依赖错误的历史记录,导致上下文通道上的训练-测试不匹配,我们称之为上下文暴露偏差。我们提出了一个统一的训练框架,以提高在现实历史情况下的鲁棒性:(i)通过使用 Whisper large-v3 假设作为训练时的历史记录获取教师错误知识;(ii)上下文 Dropout 以正则化对历史记录的依赖;(iii)针对精选的失败案例进行直接偏好优化(DPO)。在 TED-LIUM 3(领域内)和零样本 LibriSpeech(领域外)上的实验表明,在预测历史解码下 consistently 获得提升。在两句话的历史记录作为上下文的情况下,SFT 使用 Whisper 假设将 WER 从 5.59%(预言式历史训练)降至 5.47%,DPO 进一步提高至 5.17%。在无关上下文攻击下,DPO 产生最小的性能下降(5.17% -> 5.63%),表明其对误导性上下文具有更好的鲁棒性。我们的代码和模型已发布于 https://github.com/XYGuo1996/Contextual_Speech_LLMs。
引用
@article{arxiv.2603.24034,
title = {From Oracle to Noisy Context: Mitigating Contextual Exposure Bias in Speech-LLMs},
author = {Xiaoyong Guo and Nanjie Li and Zijie Zeng and Kai Wang and Hao Huang and Haihua Xu and Wei Shi},
journal= {arXiv preprint arXiv:2603.24034},
year = {2026}
}