中文

SegINR:用于神经文本到语音序列对齐的分段隐式神经表征

音频与语音处理 2024-10-22 v1 机器学习

摘要

我们提出了 SegINR,一种用于神经文本到语音(TTS)的新方法,用于序列对齐,而无需依赖辅助 duration 预测器和复杂的自回归(AR)或非自回归(NAR)帧级序列建模。SegINR 通过将文本序列直接转换为帧级特征来简化该过程。它利用最优文本编码器提取嵌入,将每个嵌入转换为使用条件隐式神经表征(INR)生成的帧级特征的片段。该方法称为分段 INR(SegINR),在每个片段内建模时间动态,自动定义片段边界,从而降低计算成本。我们将 SegINR 集成到双阶段 TTS 框架中,用其进行语义标记预测。我们的实验在零样本自适应 TTS 场景中表明,SegINR 在语音质量和计算效率方面优于传统方法。

关键词

引用

@article{arxiv.2410.04690,
  title  = {SegINR: Segment-wise Implicit Neural Representation for Sequence Alignment in Neural Text-to-Speech},
  author = {Minchan Kim and Myeonghun Jeong and Joun Yeop Lee and Nam Soo Kim},
  journal= {arXiv preprint arXiv:2410.04690},
  year   = {2024}
}

备注

This work has been submitted to the IEEE for possible publication