中文

AccentBox:迈向高保真零样本口音生成

声音 2026-02-06 v2 计算与语言 音频与语音处理

摘要

尽管最近的零样本文本到语音(ZS-TTS)模型已实现了高自然度和说话人相似度,但在口音保真度和控制方面仍有不足。为解决此问题,我们提出了零样本口音生成,它统一了外国口音转换(FAC)、带口音的TTS和ZS-TTS,并采用一个新颖的两阶段流程。在第一阶段,我们在口音识别(AID)上取得了最先进(SOTA)水平,对未见过的说话人达到了0.56的f1分数。在第二阶段,我们使用由AID模型提取的、预训练的说话人无关口音嵌入来条件化一个ZS-TTS系统。所提出的系统在固有/跨口音生成上实现了更高的口音保真度,并实现了未见口音的生成。

关键词

引用

@article{arxiv.2409.09098,
  title  = {AccentBox: Towards High-Fidelity Zero-Shot Accent Generation},
  author = {Jinzuomu Zhong and Korin Richmond and Zhiba Su and Siqi Sun},
  journal= {arXiv preprint arXiv:2409.09098},
  year   = {2026}
}

备注

Accepted by ICASSP 2025