中文

LoRP-TTS:低秩个性化文本转语音

声音 2025-02-12 v1 人工智能 音频与语音处理

摘要

语音合成模型将书面文本转换为自然听起来的音频。虽然早期模型仅限于单位说话人,但近期进展导致开发出零样本系统,可使用其声线作为额外提示生成来自广泛说话人的逼真语音。然而,这些系统仍在模拟与训练数据集显著不同的非工作室质量样本方面存在挑战。本文演示了利用低秩适应(Low-Rank Adaptation, LoRA)技术,成功使用噪声环境中自发语音的单个录音作为提示。该方法通过最高可达 30pp30pp 提升说话人相似度,同时保持内容和自然性。它标志着致力于创建真正多样化语音语料库的重要一步,这在所有语音相关任务中至关重要。

关键词

引用

@article{arxiv.2502.07562,
  title  = {LoRP-TTS: Low-Rank Personalized Text-To-Speech},
  author = {Łukasz Bondaruk and Jakub Kubiak},
  journal= {arXiv preprint arXiv:2502.07562},
  year   = {2025}
}