SecoustiCodec:跨模态对齐的流式单码本语音编解码器
音频与语音处理
2025-08-06 v1 人工智能
计算与语言
声音
摘要
语音编解码器是统一语音与文本语言模型的关键桥梁。现有编解码方法在语义编码方面面临若干挑战,如残留的副语言信息(如音色、情感)、语义完整性不足、重建能力有限以及缺乏对流式的支持。为应对这些挑战,我们提出了 SecoustiCodec,一种跨模态对齐的低比特率流式语音编解码器,它在单码本空间中解耦语义与副语言信息。为确保语义完整性与重建保真度,引入了副语言编码以弥合语义编码与声学编码之间的信息鸿沟。提出了一种基于 VAE(Variational Autoencoder,变分自编码器)和 FSQ(Finite Scalar Quantization,有限标量量化)的纯语义高效量化方法。该方法在保持高码本利用率的同时,缓解了 token 的长尾分布问题。提出了一种基于对比学习的语义解耦方法,在联合多模态帧级空间中对齐文本与语音,有效去除了语义编码中的副语言信息。提出了一种声学约束的多阶段优化策略,以确保鲁棒且稳定的收敛。图~\ref{fig:pesq_kbps_below_2kbps} 显示,SecoustiCodec 在 0.27/1 kbps 下实现了 SOTA(state-of-the-art,最优)的重建质量(PESQ),达到 1.77/2.58。SecoustiCodec 的代码和模型权重将在同行评审完成后开源。我们已开源 SecoustiCodec 的演示、代码和模型权重。
引用
@article{arxiv.2508.02849,
title = {SecoustiCodec: Cross-Modal Aligned Streaming Single-Codecbook Speech Codec},
author = {Chunyu Qiang and Haoyu Wang and Cheng Gong and Tianrui Wang and Ruibo Fu and Tao Wang and Ruilong Chen and Jiangyan Yi and Zhengqi Wen and Chen Zhang and Longbiao Wang and Jianwu Dang and Jianhua Tao},
journal= {arXiv preprint arXiv:2508.02849},
year = {2025}
}