用于自然与交互式语音合成的开源全双工对话数据集
声音
2025-09-05 v1
摘要
全双工、自发对话数据对于增强合成语音的自然性和交互性至关重要。本文提供两个开源双轨对话语音数据集,分别为中文和英文版本,旨在通过提供更真实的对话数据来提升合成语音的自然性。该两个数据集总计15小时的自然、自发对话,录制于隔离房间,产生每个说话者的高质量音频轨道。对话涵盖多样化的日常话题与领域,捕捉真实交互模式,包括频繁的语音重叠、后台响应、笑声及其他非语言声音。我们介绍数据收集程序、转录与标注方法。通过在基线TTS模型上使用所提出的数据集进行微调,我们展示了这些语料库的实用性。微调后的TTS模型在主观与客观评估指标上均优于基线,表明合成语音的自然性和对话真实性得到提升。所有数据、标注以及用于微调和评估的支持代码均已公开,以便进一步推动对话语音合成领域的研究。
引用
@article{arxiv.2509.04093,
title = {Open-Source Full-Duplex Conversational Datasets for Natural and Interactive Speech Synthesis},
author = {Zhitong Zhou and Qingqing Zhang and Lei Luo and Jiechen Liu and Ruohua Zhou},
journal= {arXiv preprint arXiv:2509.04093},
year = {2025}
}