UtterTune:多语言文本到语音中基于 LoRA 的目标语言发音编辑与控制
声音
2025-09-24 v2 计算与语言
音频与语音处理
摘要
我们提出了 UtterTune,这是一种轻量级自适应方法,用于微调基于大语言模型 (LLM) 架构的多语言文本到语音 (TTS) 系统,旨在增强目标语言的发音可控性,同时保持其他语言的性能。虽然 LLM 架构使 TTS 模型能够实现卓越的自然度,但准确建模字素到音素 (G2P) 映射和韵律仍然具有挑战性,尤其是当模型省略显式的 G2P 模块并直接处理最小编码文本(例如,字节对编码)时。UtterTune 利用低秩自适应 (LoRA) 来实现对日语(本文的目标语言)在音素级别的音段发音和音高重音的控制,同时在零样本设置中保持自然度和说话人相似度。客观和主观评估证实了其有效性。
引用
@article{arxiv.2508.09767,
title = {UtterTune: LoRA-Based Target-Language Pronunciation Edit and Control in Multilingual Text-to-Speech},
author = {Shuhei Kato},
journal= {arXiv preprint arXiv:2508.09767},
year = {2025}
}
备注
5 pages