中文

语音信号的深度生成分解

声音 2020-10-28 v1 机器学习 音频与语音处理

摘要

各种信息因子在语音信号中混合,这构成了大多数语音信息处理任务的主要困难。一个直观的想法是将语音信号分解为独立的信息因子(例如音素内容与说话人特征),尽管这被证明极具挑战性。本文提出一种基于新颖的因子判别归一化流模型(factorial DNF)的语音分解方法。在涉及音素内容与说话人特征的两因子案例上进行的实验表明,所提出的 factorial DNF 具有强大的语音信号分解能力,并在信息表示与操控方面优于若干对比模型。

关键词

引用

@article{arxiv.2010.14242,
  title  = {Deep generative factorization for speech signal},
  author = {Haoran Sun and Lantian Li and Yunqi Cai and Yang Zhang and Thomas Fang Zheng and Dong Wang},
  journal= {arXiv preprint arXiv:2010.14242},
  year   = {2020}
}

备注

Submitted to ICASSP 2021