AAS-VC:基于自动对齐搜索的非自回归序列到序列语音转换的泛化能力研究
声音
2023-09-18 v2 音频与语音处理
摘要
用于语音转换(VC)的非自回归(non-AR)序列到序列(seq2seq)模型因其能有效建模时间结构,并借助非自回归建模获得更高的可懂度和快速推理而颇具吸引力。然而,当前非自回归 seq2seq 语音转换模型对从外部自回归模型提取的真实时长(ground truth durations)的依赖,极大限制了其在较小训练数据集上的泛化能力。本文首先通过改变训练数据规模展示了上述问题。随后,我们提出 AAS-VC,一种基于自动对齐搜索(AAS)的非自回归 seq2seq 语音转换模型,它去除了对外部时长的依赖,并作为一种恰当的归纳偏置,为小数据集提供所需的泛化能力。实验结果表明,AAS-VC 能更好地泛化到仅 5 分钟的训练数据集。我们还进行了消融实验以论证若干模型设计选择的合理性。音频样本与实现代码已在线提供。
引用
@article{arxiv.2309.07598,
title = {AAS-VC: On the Generalization Ability of Automatic Alignment Search based Non-autoregressive Sequence-to-sequence Voice Conversion},
author = {Wen-Chin Huang and Kazuhiro Kobayashi and Tomoki Toda},
journal= {arXiv preprint arXiv:2309.07598},
year = {2023}
}
备注
Submitted to ICASSP 2024. Demo: https://unilight.github.io/Publication-Demos/publications/aas-vc/index.html. Code: https://github.com/unilight/seq2seq-vc