中文

面向CoVoC挑战2024的Codec语言模型基零样图自发风格TTS系统

声音 2025-02-05 v2 音频与语音处理

摘要

本文描述了为ISCSLP 2024对话式语音克隆挑战 (CoVoC) 设计的零样图自发风格TTS系统。我们提出了基于LLaMA的Codec语言模型,结合延迟模式,以实现自发风格语音克隆。为提高语音可理解性,我们在语言模型中引入了无分类引导 (CFG) 策略,以强化对标记预测的条件引导。为生成高质量的语音,我们采用有效的数据预处理操作,并使用精选的高质量自发语音数据进行微调。官方在CoVoC受限轨道上的评估显示,我们的系统实现了最佳的语音自然度MOS评分3.80,并在语音质量和说话人相似性方面取得了可观的成绩。

关键词

引用

@article{arxiv.2412.01100,
  title  = {The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024},
  author = {Shuoyi Zhou and Yixuan Zhou and Weiqin Li and Jun Chen and Runchuan Ye and Weihao Wu and Zijian Lin and Shun Lei and Zhiyong Wu},
  journal= {arXiv preprint arXiv:2412.01100},
  year   = {2025}
}

备注

Accepted by ISCSLP 2024