中文

Marco-Voice 技术报告

计算与语言 2025-08-15 v4 声音 音频与语音处理

摘要

本文提出一种多功能语音合成系统,将语音克隆与情感控制语音合成集成到统一框架中。本工作旨在解决实现高度表达、可控且自然的语音生成、并在多样化语言和情感情境下忠实保留说话人身份的长期挑战。我们的方法引入了一种有效的说话人-情感解耦机制,采用批量对比学习,实现对说话人身份与情感风格的独立操控,同时提出了旋转情感嵌入集成方法以实现平滑的情感控制。为支持全面的训练与评估,我们构建了 CSEMOTIONS 数据集,包含来自六名专业说话人的 10 小时普通话语音,覆盖七种情感类别。大量实验表明,Marco-Voice 系统在客观与主观指标上均实现了显著提升。综合评估和分析结果表明,MarcoVoice 在语音清晰度和情感丰富性方面表现具竞争力,代表了神经语音合成表达性领域的重要进展。我们的代码与数据集分别已公开于 https://github.com/AIDC-AI/Marco-Voice 和 https://huggingface.co/datasets/AIDC-AI/CSEMOTIONS。

关键词

引用

@article{arxiv.2508.02038,
  title  = {Marco-Voice Technical Report},
  author = {Fengping Tian and Chenyang Lyu and Xuanfan Ni and Haoqin Sun and Qingjuan Li and Zhiqiang Qian and Haijun Li and Longyue Wang and Zhao Xu and Weihua Luo and Kaifu Zhang},
  journal= {arXiv preprint arXiv:2508.02038},
  year   = {2025}
}

备注

Technical Report. Our code and dataset are publicly available at https://github.com/AIDC-AI/Marco-Voice and https://huggingface.co/datasets/AIDC-AI/CSEMOTIONS respectively