中文

Speaking Clearly: 基于 Whisper 的低比特率语音编码器

声音 2026-01-28 v2

摘要

语音编码器作为连续语音信号与大型语言模型之间的桥梁,但面临声学保真度与语义保持之间的内在冲突。为缓解这一冲突,现有方法通过复杂的语义监督来增强声学编码器。我们探索了另一方向:一种语义优先的方法,从语义能力模型出发并将其适用于高保真声学重建。通过经验分析,我们发现有针对性的架构简化可以释放 Whisper 的声学建模潜力。基于这一发现,我们提出了 SimWhisper-Codec,一种 novel 编码器,通过利用冻结的、简化的 Whisper 编码器来平衡语义保持和声学质量,而无需外部监督。实验结果表明,SimWhisper-Codec 在语义保持和声学质量方面均优于具有语义监督的编码器,如 Mimi Codec 和 SpeechTokenizer,在类似比特率下表现更佳,验证了该语义优先方法的有效性。代码可在 https://github.com/ZhangXinWhut/SimWhisper-Codec 获取。

关键词

引用

@article{arxiv.2510.20504,
  title  = {Speaking Clearly: A Simplified Whisper-Based Codec for Low-Bitrate Speech Coding},
  author = {Xin Zhang and Lin Li and Xiangni Lu and Jianquan Liu and Kong Aik Lee},
  journal= {arXiv preprint arXiv:2510.20504},
  year   = {2026}
}

备注

Accepted by ICASSP 2026