中文

快速联结主义说话人自适应

声音 2022-11-17 v1 人工智能 音频与语音处理

摘要

我们提出 SVCnet,一种用于建模说话人可变性的系统。专为各语音音素特化的编码器神经网络产生声学变化的低维模型,这些模型进一步组合为整体的嗓音可变性模型。我们描述了一种训练过程,使该模型对已由哪些音素发声的依赖最小化。利用训练好的模型(SVCnet)和新说话人简短无约束的语音样本,系统生成说话人嗓音码,可用于使识别系统自适应新说话人而无需重训练。文中描述了一种将 SVCnet 与 MS-TDNN 识别器相结合的系统。

关键词

引用

@article{arxiv.2211.08978,
  title  = {Rapid Connectionist Speaker Adaptation},
  author = {Michael Witbrock and Patrick Haffner},
  journal= {arXiv preprint arXiv:2211.08978},
  year   = {2022}
}

备注

6 Figures, Two Tables, ICASSP-92