基于离散标记的增强式外来语音调模拟:仅使用母语语料库
声音
2025-05-23 v1 音频与语音处理
摘要
最近提出了一种仅使用母语语料数据通过自监督学习模型获取的离散标记来合成外来语音的方法。考虑到准外来语音数据的可得性有限,这种方法有望大大简化外来语音的模拟。通过将合成的外来语音用作人类的听觉材料或自动语音识别(ASR)的训练数据,二者都能提高对外来语的鲁棒性。然而,该方法存在致命缺陷,无法复现与持续时间相关的语音特征。持续时间特征在二语学习者(其母语具有音节计时或音节时序韵律)讲话计时语言(如英语)时常见。本文将持续时间修改集成到该方法中,以更准确地模拟外来语。实验表明,所提方法成功复制了真实二语语音中看到的持续时间特征。
引用
@article{arxiv.2505.16191,
title = {Prosodically Enhanced Foreign Accent Simulation by Discrete Token-based Resynthesis Only with Native Speech Corpora},
author = {Kentaro Onda and Keisuke Imoto and Satoru Fukayama and Daisuke Saito and Nobuaki Minematsu},
journal= {arXiv preprint arXiv:2505.16191},
year = {2025}
}
备注
Accepted by Interspeech2025