中文

低资源环境下尼泊尔语的多说话人神经语音克隆

声音 2026-01-27 v1 人工智能

摘要

本研究提出了一种面向尼泊尔语说话人的少样本语音克隆系统,旨在使用最少的数据从Devanagari文本中合成特定说话人声音的语音。由于其低资源的特性,尼泊尔语的语音克隆在很大程度上尚未被探索。为了解决这一问题,我们构建了独立的数据集:用于训练说话人编码器的未转录音频,以及用于训练基于Tacotron2的合成器的配对文本-音频数据。说话人编码器使用生成式End2End损失进行优化,生成捕获说话人声音身份的嵌入,并通过统一流形逼近与投影(UMAP)进行降维可视化验证。这些嵌入与Tacotron2的文本嵌入融合以生成mel频谱图,随后使用WaveRNN声码器将其转换为音频。音频数据收集自包括自录在内的多种来源,并经过了彻底的预处理以保证质量和对齐。训练在多种超参数设置下使用mel和gate损失函数进行。该系统即使对未见过的声音也能有效克隆说话人特征,证明了尼泊尔语少样本语音克隆的可行性,并为低资源场景下的个性化语音合成奠定了基础。

关键词

引用

@article{arxiv.2601.18694,
  title  = {Neural Multi-Speaker Voice Cloning for Nepali in Low-Resource Settings},
  author = {Aayush M. Shrestha and Aditya Bajracharya and Projan Shakya and Dinesh B. Kshatri},
  journal= {arXiv preprint arXiv:2601.18694},
  year   = {2026}
}

备注

16 pages with appendix included