通过知识蒸馏与来自本土 TTS 的合成基准实现发音与方言转换提升
声音
2025-03-05 v2 人工智能
音频与语音处理
摘要
先前的方言转换(AC)方法主要致力于使非本土语音听起来更像本土语音,同时保持原始内容和说话人身份。然而,非本土说话者有时会存在发音问题,可能导致听者难以理解。因此,我们开发了一种新的 AC 方法,不仅关注方言转换,还改进了非本土语音的发音。通过提供非本土音频及其对应的文字,我们生成带有原时长和韵律的具有本土式发音的理想基准音频。此基准数据帮助模型学习非本土语音与本土语音之间的直接映射。我们采用端到端 VITS 框架实现 AC 任务的高质量波形重建。结果表明,我们的系统不仅能产生接近本土方言的音频,同时保留原始说话人身份,还能显著改善发音。
引用
@article{arxiv.2410.14997,
title = {Improving Pronunciation and Accent Conversion through Knowledge Distillation And Synthetic Ground-Truth from Native TTS},
author = {Tuan Nam Nguyen and Seymanur Akti and Ngoc Quan Pham and Alexander Waibel},
journal= {arXiv preprint arXiv:2410.14997},
year = {2025}
}
备注
accepted at ICASSP 2025