面向语音口音转换与发音改进的流式非自回归模型
计算与语言
2025-06-23 v1 声音
音频与语音处理
摘要
我们提出首个流式语音口音转换 (AC) 模型,通过保留说话人身份、韵律并改进发音,将非母语语音转换为母语式口音。我们的做法通过修改先前的 AC 架构引入 Emformer 编码器和优化的推理机制实现流式处理。此外,我们集成了本地文本转语音 (TTS) 模型以生成理想的基准数据以高效训练。我们的流式 AC 模型在保持稳定延迟的同时实现了与顶级 AC 模型相当的性能,成为首个能够实现流式的 AC 系统。
引用
@article{arxiv.2506.16580,
title = {Streaming Non-Autoregressive Model for Accent Conversion and Pronunciation Improvement},
author = {Tuan-Nam Nguyen and Ngoc-Quan Pham and Seymanur Akti and Alexander Waibel},
journal= {arXiv preprint arXiv:2506.16580},
year = {2025}
}
备注
Accepted to INTERSPEECH 2025