中文

Whisper-CD:使用多負例對比解碼的精確長篇語音識別

声音 2026-03-09 v1 人工智能 音频与语音处理

摘要

大型編碼解碼模型如 Whisper 的長篇語音識別常見幻覺、重複循環和內容遺漏。這些錯誤在使用前一段譯文作為解碼上下文時會進一步放大。我們提出 Whisper-CD,一種無需訓練的對比式解碼框架,通過對三種編碼學習性擾動(高斯噪聲注入、靜默信號和音頻時間平移)計算的負 logits 與乾淨音頻 logits 進行對比。我們通過 log-sum-exp 運算將這些負數匯聚,構建基於 token-by-token 解碼的統一多負目標。在五個英文長篇基準測試中,Whisper-CD 在 CORAAL 上將 WER 降低最高可達 24.3 百分點,并將 token 生成吞吐量提高 48%。由於 Whisper-CD 僅在推理時運作,可作為無需重新訓練即可部署於已有 Whisper 系統的即插即用替代方案。

关键词

引用

@article{arxiv.2603.06193,
  title  = {Whisper-CD: Accurate Long-Form Speech Recognition using Multi-Negative Contrastive Decoding},
  author = {Hoseong Ahn and Jeongyun Chae and Yoonji Park and Kyuhong Shim},
  journal= {arXiv preprint arXiv:2603.06193},
  year   = {2026}
}

备注

Submitted to Interspeech 2026