中文

语义级别训练与完整对话训练的成本与收益:一项比较研究

计算与语言 2025-05-13 v1 声音 音频与语音处理

摘要

现代面向对话的语音合成系统虽然实现了高质量的语音,但往往难以公开获取。现有的开源架构是否不足,还是当前训练技术是否不充分?本文通过实证研究,探讨了主流模型及其在对话语境下的行为特征。使用20个GPU小时的NVIDIA H100,我们检验了两种方法:基于上下文的语义级别训练与完整对话训练。结果表明,基于上下文的语义训练在MOS评分上取得更佳表现(4.3/5.0 vs 3.7/5.0),训练时间缩短37%,而完整对话方法则出现说话人相似幻觉问题。这些发现为对话式语音合成开发提供了实用指南,推荐采用带上下文条件的语义训练,以实现资源效率与输出质量的双重提升。

关键词

引用

@article{arxiv.2505.07202,
  title  = {On the Cost and Benefits of Training Context with Utterance or Full Conversation Training: A Comparative Stud},
  author = {Hyouin Liu and Zhikuan Zhang},
  journal= {arXiv preprint arXiv:2505.07202},
  year   = {2025}
}