中文

CodeSep: 基于低比特率编解码器驱动、结合基令牌解缠与辅助令牌串行预测的语音分离

音频与语音处理 2026-01-21 v1

摘要

本文针对一种将语音分离与语音压缩相结合的新场景,旨在解缠多个说话者的同时生成离散表示以实现高效传输或存储,应用于在线会议和对话存档。为应对此场景,我们提出了CodeSep,一种联合执行语音分离和低比特率压缩的编解码器驱动模型。CodeSep包含一个基于残差向量量化器(RVQ)的普通神经语音编解码器、一个基令牌解缠(BTD)模块和多个并行辅助令牌串行预测(ATSP)模块。BTD模块将混合语音的梅尔频谱图解缠为每个说话者的基令牌,然后由ATSP模块精炼以串行预测辅助令牌,最后所有令牌通过编解码器解码器解码以重建分离的波形。在训练期间,编解码器的RVQ通过基于排列不变和教师强制的交叉熵损失提供监督。由于仅传输或存储基令牌,CodeSep实现了低比特率压缩。实验结果表明,与基线方法相比,CodeSep在仅1 kbps的比特率下获得了令人满意的分离性能。

关键词

引用

@article{arxiv.2601.12757,
  title  = {CodeSep: Low-Bitrate Codec-Driven Speech Separation with Base-Token Disentanglement and Auxiliary-Token Serial Prediction},
  author = {Hui-Peng Du and Yang Ai and Xiao-Hang Jiang and Rui-Chen Zheng and Zhen-Hua Ling},
  journal= {arXiv preprint arXiv:2601.12757},
  year   = {2026}
}

备注

Accepted by ICASSP 2026