CosyAccent:使用源综合训练数据的持续可控语音口音规范化
音频与语音处理
2026-02-24 v1 人工智能
声音
摘要
语音口音规范化 (AN) 系统常常在生成不自然的输出和不希望的内容失真方面受到限制,这源于次优训练数据和刚性持续建模。在本文中,我们提出了一种“源综合”方法用于构建训练数据。通过生成源 L2 语音并使用真实母语语音作为训练目标,我们的方法避免了学习 TTS 伪影,关键的是在训练期间无需真实 L2 数据。除了这一数据策略,我们引入了 CosyAccent,一种非自回归模型,用于解决语感自然性和持续控制之间的权衡。CosyAccent 隐式地建模节奏以实现灵活性,同时可对总输出持续时间进行显式控制。实验表明,尽管在没有任何真实 L2 语音的情况下训练,CosyAccent 仍能显著改进内容保真度和优异的自然度,优于强大的基线,这些基线是在真实世界数据上训练的。
引用
@article{arxiv.2602.19166,
title = {CosyAccent: Duration-Controllable Accent Normalization Using Source-Synthesis Training Data},
author = {Qibing Bai and Shuhao Shi and Shuai Wang and Yukai Ju and Yannan Wang and Haizhou Li},
journal= {arXiv preprint arXiv:2602.19166},
year = {2026}
}
备注
Accepted to ICASSP 2026