DSA-Tokenizer:通过基于流匹配的分层融合实现解耦的语义-声学标记化
声音
2026-05-28 v4 人工智能
音频与语音处理
摘要
语音标记器是完全离散的Speech LLM的关键构建模块。现有的标记器要么优先考虑语义编码,要么将语义内容与声学风格不可分割地融合在一起,要么只能实现不完整的语义-声学解耦。为了实现更好的解耦,我们提出了DSA-Tokenizer,它通过不同的优化约束将语音显式解耦为离散的语义和声学标记。具体而言,语义标记由ASR监督以捕获语言内容,而声学标记则专注于mel-spectrograms恢复以编码风格。我们进一步引入了分层Flow Matching解码器和联合重建-上下文修复训练策略,使模型能够支持高保真重建和跨话语语音克隆。为了加速推理,我们蒸馏DiT解码器将推理采样步骤减少至4步,并通过GAN微调提高合成质量。实验表明,DSA-Tokenizer提供了强大的语义-声学解耦、可靠的可控语音克隆,以及具有低WER/CER的高效高保真生成。此外,我们的结果表明,解耦的标记化为下游大模型语音生成提供了更有效的接口。音频样本可在 https://anonymous.4open.science/w/DSA_Tokenizer_demo/ 获取。
引用
@article{arxiv.2601.09239,
title = {DSA-Tokenizer: Disentangled Semantic-Acoustic Tokenization via Flow Matching-based Hierarchical Fusion},
author = {Hanlin Zhang and Daxin Tan and Dehua Tao and Xiao Chen and Haochen Tan and Yunhe Li and Yuchen Cao and Linqi Song},
journal= {arXiv preprint arXiv:2601.09239},
year = {2026}
}
备注
Submit to ACL ARR 2026 May