中文

技术报告:时长预测对印度语言特定人 TTS 的影响

音频与语音处理 2025-07-24 v1 机器学习

摘要

由于数据有限和语言结构多样化,为许多印度语言等低资源语言生成高质量语音仍然是一个重大挑战。时长预测是许多语音生成流程中的关键组件,在建模韵律和语音节奏方面起着关键作用。虽然最近的一些生成式方法选择省略显式的时长建模,但这通常以更长的训练时间为代价。我们保留并探索了该模块,以更好地了解其在印度语言丰富且数据匮乏的环境中的影响。我们使用公开可用的印度语言数据训练了一个基于非自回归连续归一化流(CNF)的语音模型,并评估了多种用于零样本、特定人生成的时长预测策略。我们对语音填补任务的比较分析揭示了微妙的权衡:在某些语言中,基于填补的预测器提高了可懂度,而在另一些语言中,特定人提示的预测器更好地保留了说话人特征。这些发现为针对特定语言和任务量身定制的时长策略的设计和选择提供了信息,突显了时长预测等可解释组件在将先进的生成式架构适应于低资源、多语言环境中的持续价值。

关键词

引用

@article{arxiv.2507.16875,
  title  = {Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages},
  author = {Isha Pandey and Pranav Gaikwad and Amruta Parulekar and Ganesh Ramakrishnan},
  journal= {arXiv preprint arXiv:2507.16875},
  year   = {2025}
}