中文

说、编辑、重复:基于交叉注意力Mamba的高保真语音编辑与零样图TTS

声音 2025-10-07 v1 人工智能 计算与语言 机器学习 音频与语音处理

摘要

我们提出MAVE(Mamba with Cross-Attention for Voice Editing and Synthesis),一种基于交叉注意力Mamba backbone的新型自回归架构,用于文本条件语音编辑和高保真文本转语音(TTS)合成。MAVE在语音编辑和零样图TTS任务上实现了最佳性能,尽管并未专门在后者任务上训练,却在多样化真实音频上超越了领先的自回归和扩散模型。通过将Mamba用于高效音频序列建模,结合交叉注意力实现文本-声学精准对齐,MAVE实现了上下文感知语音编辑,展现卓越的自然度和说话人一致性。在RealEdit基准的随机40样本子集上进行的两两人类评估中,57.2%的听众认为MAVE编辑后的语音与原语音等效,24.8%的听众更喜欢原语音,18.0%的听众更喜欢MAVE。MAVE在两两比较和独立的平均意见分(MOS)评估中都表现优于VoiceCraft。对于零样图TTS,MAVE在说话人相似度和自然度方面超越VoiceCraft,且无需多次推理或后处理。值得注意的是,这些质量提升伴随着显著降低的内存消耗和约相同延迟:MAVE在RealEdit数据库中的utterances上推理时,仅需VoiceCraft的约6倍内存(平均时长:6.21秒,A100,FP16,batch size 1)。我们的结果表明,MAVE通过结构化状态空间建模与跨模态注意力的协同集成,为灵活、高保真的语音编辑和合成树立了新标准。

关键词

引用

@article{arxiv.2510.04738,
  title  = {Speak, Edit, Repeat: High-Fidelity Voice Editing and Zero-Shot TTS with Cross-Attentive Mamba},
  author = {Baher Mohammad and Magauiya Zhussip and Stamatios Lefkimmiatis},
  journal= {arXiv preprint arXiv:2510.04738},
  year   = {2025}
}