中文

VITS 与 Style-BERT-VITS2 日语人物文本语音的表达性比较评估

计算与语言 2025-12-02 v2 声音 音频与语音处理

摘要

合成带有音高-重音敏感性和风格变异性的日语人物语音具有独特的挑战。本文对两个开源文本语音模型——VITS 和 Style-BERT-VITS2 JP Extra (SBV2JE)—在基于人物的日语语音上的表现进行经验性评估。我们使用三个角色特定数据集,对模型在自然度(平均意见评分和比较平均意见评分)、可理解性(词错误率)和说话者一致性方面进行评估。SBV2JE 在自然度上与人类基准相当(MOS 4.37 对 4.38),实现更低的 WER,并在 CMOS 中略胜一筹。虽然计算需求更高,SBV2JE 仍因受益于音高-重音控制和基于 WavLM 的判别器,对于语言学习和人物对话生成等应用表现出色。

关键词

引用

@article{arxiv.2505.17320,
  title  = {Comparative Evaluation of Expressive Japanese Character Text-to-Speech with VITS and Style-BERT-VITS2},
  author = {Zackary Rackauckas and Julia Hirschberg},
  journal= {arXiv preprint arXiv:2505.17320},
  year   = {2025}
}

备注

Accepted to IEEE UEMCON 2025