语义级别训练与完整对话训练的成本与收益:一项比较研究
计算与语言
2025-05-13 v1 声音
音频与语音处理
摘要
现代面向对话的语音合成系统虽然实现了高质量的语音,但往往难以公开获取。现有的开源架构是否不足,还是当前训练技术是否不充分?本文通过实证研究,探讨了主流模型及其在对话语境下的行为特征。使用20个GPU小时的NVIDIA H100,我们检验了两种方法:基于上下文的语义级别训练与完整对话训练。结果表明,基于上下文的语义训练在MOS评分上取得更佳表现(4.3/5.0 vs 3.7/5.0),训练时间缩短37%,而完整对话方法则出现说话人相似幻觉问题。这些发现为对话式语音合成开发提供了实用指南,推荐采用带上下文条件的语义训练,以实现资源效率与输出质量的双重提升。
引用
@article{arxiv.2505.07202,
title = {On the Cost and Benefits of Training Context with Utterance or Full Conversation Training: A Comparative Stud},
author = {Hyouin Liu and Zhikuan Zhang},
journal= {arXiv preprint arXiv:2505.07202},
year = {2025}
}