中文

从连续到离散:基于分层语言模型的跨域协作式通用语音增强

声音 2025-07-28 v1 音频与语音处理

摘要

本文引入 OmniGSE,一种新型通用语音增强(GSE)框架,旨在缓解语音信号在现实场景中遇到的多样性失真。这些失真包括背景噪声、混响、带宽限制、信号削波及网络数据包丢失等。现有方法通常侧重于针对单一类型失真进行优化,难以有效处理复杂场景中多种失真的共存情况。OmniGSE 通过融合判别方法与生成方法的优势,构建双阶段架构,实现跨域协作优化。在第一阶段,使用轻量级通道分割 NAC-RoFormer 对连续特征进行增强。在第二阶段,通过语言模型生成离散标记以重构高质量语音。具体而言,我们设计了包含 RootLM 和多个 BranchLM 的分层语言模型结构。RootLM 模型化跨越不同码本层的通用声学特征,而 BranchLM 则显式捕获不同码本水平之间的渐进关系。实验结果表明,OmniGSE 在多个基准测试中超越现有模型,尤其在包含复合失真的场景中表现尤为出色。这些发现凸显了该框架在现实应用中实现稳健且通用的语音增强潜力。

关键词

引用

@article{arxiv.2507.19062,
  title  = {From Continuous to Discrete: Cross-Domain Collaborative General Speech Enhancement via Hierarchical Language Models},
  author = {Zhaoxi Mu and Rilin Chen and Andong Li and Meng Yu and Xinyu Yang and Dong Yu},
  journal= {arXiv preprint arXiv:2507.19062},
  year   = {2025}
}

备注

ACMMM 2025