MoonCast:高质量零样本播客生成
音频与语音处理
2025-03-20 v2 人工智能
计算与语言
机器学习
声音
摘要
最近的文本语音合成技术在生成单个说话者的高质量短语段方面取得了显著进展。然而,这些系统在扩展到实际场景中常见的长篇、多说话者和自发对话方面仍面临挑战,例如播客。这些限制主要源于两个挑战:1)长语音:播客通常持续数分钟,超过了大多数现有研究的上限;2)自然性:播客以其自发、口语化的特性著称,这与正式、书面语境形成鲜明对比;现有方法在捕捉这种自然性方面仍不足。本文提出了MoonCast,一种用于高质量零样本播客生成的解决方案,旨在从仅包含文本的来源(例如TXT、PDF或Web URL格式的故事、技术报告或新闻)中,利用不可见说话者的语音合成出自然的播客风格语音。为生成长音频,我们采用基于大规模长上下文语音数据的长情境语言模型进行音频建模。为增强自然性,我们利用播客生成模块生成带有自发细节的脚本,这些细节被实证证明与文本语音建模本身同样关键。实验表明,MoonCast在基线模型之上取得了显著提升,尤其在自然性和连贯性方面表现尤为突出。
引用
@article{arxiv.2503.14345,
title = {MoonCast: High-Quality Zero-Shot Podcast Generation},
author = {Zeqian Ju and Dongchao Yang and Jianwei Yu and Kai Shen and Yichong Leng and Zhengtao Wang and Xu Tan and Xinyu Zhou and Tao Qin and Xiangyang Li},
journal= {arXiv preprint arXiv:2503.14345},
year = {2025}
}