从幻觉到清晰表达:面向超低比特率神经语音编码的语言模型驱动损失
音频与语音处理
2026-02-09 v1
摘要
“音素幻觉(PH)”在基于DNN的低比特率编解码器中普遍存在。这是生成式解码器试图从过度压缩且丢失部分语义信息的令牌中合成合理输出的尝试。在这项工作中,我们提出了语言模型驱动损失(LM loss),并表明在极低比特率设置下,它们可能比语义蒸馏(SD)目标更好地缓解PH。所提出的LM损失建立在预训练用于关联语音与文本的语言模型之上。当真实转录不可用时,我们建议修改流行的自动语音识别(ASR)模型Whisper,将解码后的语句与ASR推断出的输入语音转录进行比较。否则,我们建议使用定时文本正则化器(TTR)将解码语句的WavLM表示与真实转录的BERT表示进行比较。我们使用一个参考编解码器测试并比较了LM损失与SD目标,该参考编解码器的三阶段训练方案是仿照几种流行编解码器设计的。主观和客观评估得出结论,LM损失可以为从自监督语音表示中提取语义信息提供更强的指导,在保持整体输出质量的同时,提升人类感知的语义一致性。演示样本、代码和检查点可在线获取。
引用
@article{arxiv.2602.06213,
title = {From Hallucination to Articulation: Language Model-Driven Losses for Ultra Low-Bitrate Neural Speech Coding},
author = {Jayeon Yi and Minje Kim},
journal= {arXiv preprint arXiv:2602.06213},
year = {2026}
}
备注
To appear in ICASSP 2026. Demo wavs, code, and checkpoints (currently) availble at https://github.com/stet-stet/lmloss-icassp2026