中文

OmniCodec:面向低帧率的通用音频编解码器与语义-声学解耦

音频与语音处理 2026-03-24 v1

摘要

大型语言模型(LLM)通过离散表示学习推进了音频生成,但大多数现有神经编解码器聚焦于语音并强调重构保真度,忽略了跨语音、音乐和通用声音等多样化音频领域的统一低帧率建模。此外,高重构质量并不一定产生富有信息量的语义表征,限制了其在下游生成任务中的效果。我们提出 OmniCodec,一个为低帧率量身定制的通用神经音频编解码器。它采用分层多码本设计,通过利用预训练理解模型的音频编码器实现语义-声学解耦,并引入自指导策略提升码本利用率和重构质量。与 Mimi 编解码器比较,实验表明 OmniCodec 在相同比特率下实现卓越性能,重构质量优于 Mimi,同时提供更具语义信息的表征,为下游生成任务带来显著益处。我们的模型和代码将开源。我们的演示页面已公开。

关键词

引用

@article{arxiv.2603.20638,
  title  = {OmniCodec: Low Frame Rate Universal Audio Codec with Semantic-Acoustic Disentanglement},
  author = {Jingbin Hu and Haoyu Zhang and Dake Guo and Qirui Zhan and Wenhao Li and Huakang Chen and Guobin Ma and Hanke Xie and Chengyou Wang and Pengyuan Xie and Chuan Xie and Qiang Zhang and Lei Xie},
  journal= {arXiv preprint arXiv:2603.20638},
  year   = {2026}
}