CoVoMix2:基于全非自回归流匹配的零样本对话生成进阶
声音
2025-10-21 v2 人工智能
音频与语音处理
摘要
生成自然逼真的多说话人对话对于播客创作、虚拟代理和多媒体内容生成等应用至关重要。然而,现有系统难以保持说话人一致性、对重叠语音进行建模以及高效合成连贯的对话。在本文中,我们介绍了 CoVoMix2,一个用于零样本多说话人对话生成的全非自回归框架。CoVoMix2 使用基于流匹配的生成模型直接从多流转录预测梅尔频谱图,消除了对中间 token 表示的依赖。为了更好地捕捉真实的对话动态,我们提出了转录级说话人解耦、句子级对齐和提示级随机掩码策略。我们的方法实现了最先进的性能,在语音质量、说话人一致性和推理速度上优于 MoonCast 和 Sesame 等强基线。值得注意的是,CoVoMix2 在无需提示转录的情况下即可运行,并支持可控对话生成,包括重叠语音和精确的时序控制,展示了对真实世界语音生成场景的强泛化能力。
引用
@article{arxiv.2506.00885,
title = {CoVoMix2: Advancing Zero-Shot Dialogue Generation with Fully Non-Autoregressive Flow Matching},
author = {Leying Zhang and Yao Qian and Xiaofei Wang and Manthan Thakker and Dongmei Wang and Jianwei Yu and Haibin Wu and Yuxuan Hu and Jinyu Li and Yanmin Qian and Sheng Zhao},
journal= {arXiv preprint arXiv:2506.00885},
year = {2025}
}
备注
Neural Information Processing Systems 2025, poster