中文

UtterTune:多语言文本到语音中基于 LoRA 的目标语言发音编辑与控制

声音 2025-09-24 v2 计算与语言 音频与语音处理

摘要

我们提出了 UtterTune,这是一种轻量级自适应方法,用于微调基于大语言模型 (LLM) 架构的多语言文本到语音 (TTS) 系统,旨在增强目标语言的发音可控性,同时保持其他语言的性能。虽然 LLM 架构使 TTS 模型能够实现卓越的自然度,但准确建模字素到音素 (G2P) 映射和韵律仍然具有挑战性,尤其是当模型省略显式的 G2P 模块并直接处理最小编码文本(例如,字节对编码)时。UtterTune 利用低秩自适应 (LoRA) 来实现对日语(本文的目标语言)在音素级别的音段发音和音高重音的控制,同时在零样本设置中保持自然度和说话人相似度。客观和主观评估证实了其有效性。

关键词

引用

@article{arxiv.2508.09767,
  title  = {UtterTune: LoRA-Based Target-Language Pronunciation Edit and Control in Multilingual Text-to-Speech},
  author = {Shuhei Kato},
  journal= {arXiv preprint arXiv:2508.09767},
  year   = {2025}
}

备注

5 pages