语音转换领域中深度神经结构及其可解释性的研究
声音
2021-02-24 v1 音频与语音处理
摘要
生成对抗网络(GANs)是基于生成合成数据的机器学习网络。语音转换(VC)是语音翻译的一个子集,涉及将源说话人的副语言特征转换为目标说话人,同时保留语言信息。用于 VC 的非平行条件 GAN 的目标是在无配对数据的情况下将声学语音特征序列从一个域转换到另一个域。在此报告的研究中,我们调查了 VC 领域中非平行 GAN 最先进实现的可解释性。我们表明,特定 GAN 架构中重复层的学习表示仍接近其原始随机初始化参数,证明是重复层的数量而非其他对输出质量负有更大责任。我们还分析了在一个特定数据集上训练的模型在迁移学习用于另一数据集时所学到的表示。这显示出整个网络极高程度的相似性。这些结果共同为深度生成网络的学习表示在学习过程中如何变化以及层数重要性提供了新见解。
引用
@article{arxiv.2102.11420,
title = {Investigating Deep Neural Structures and their Interpretability in the Domain of Voice Conversion},
author = {Samuel J. Broughton and Md Asif Jalal and Roger K. Moore},
journal= {arXiv preprint arXiv:2102.11420},
year = {2021}
}
备注
For demo, see https://samuelbroughton.github.io/interpretability-demo-2020/