AccentBox:迈向高保真零样本口音生成
声音
2026-02-06 v2 计算与语言
音频与语音处理
摘要
尽管最近的零样本文本到语音(ZS-TTS)模型已实现了高自然度和说话人相似度,但在口音保真度和控制方面仍有不足。为解决此问题,我们提出了零样本口音生成,它统一了外国口音转换(FAC)、带口音的TTS和ZS-TTS,并采用一个新颖的两阶段流程。在第一阶段,我们在口音识别(AID)上取得了最先进(SOTA)水平,对未见过的说话人达到了0.56的f1分数。在第二阶段,我们使用由AID模型提取的、预训练的说话人无关口音嵌入来条件化一个ZS-TTS系统。所提出的系统在固有/跨口音生成上实现了更高的口音保真度,并实现了未见口音的生成。
引用
@article{arxiv.2409.09098,
title = {AccentBox: Towards High-Fidelity Zero-Shot Accent Generation},
author = {Jinzuomu Zhong and Korin Richmond and Zhiba Su and Siqi Sun},
journal= {arXiv preprint arXiv:2409.09098},
year = {2026}
}
备注
Accepted by ICASSP 2025