快速联结主义说话人自适应
声音
2022-11-17 v1 人工智能
音频与语音处理
摘要
我们提出 SVCnet,一种用于建模说话人可变性的系统。专为各语音音素特化的编码器神经网络产生声学变化的低维模型,这些模型进一步组合为整体的嗓音可变性模型。我们描述了一种训练过程,使该模型对已由哪些音素发声的依赖最小化。利用训练好的模型(SVCnet)和新说话人简短无约束的语音样本,系统生成说话人嗓音码,可用于使识别系统自适应新说话人而无需重训练。文中描述了一种将 SVCnet 与 MS-TDNN 识别器相结合的系统。
引用
@article{arxiv.2211.08978,
title = {Rapid Connectionist Speaker Adaptation},
author = {Michael Witbrock and Patrick Haffner},
journal= {arXiv preprint arXiv:2211.08978},
year = {2022}
}
备注
6 Figures, Two Tables, ICASSP-92