中文

基于克隆网络的显著语音表征

音频与语音处理 2019-08-21 v1 声音

摘要

我们将显著特征定义为被系统设计者定义为等价的信号所共享的特征。该定义允许设计者贡献定性信息。我们旨在寻找可用作生成网络条件输入的显著特征。我们通过联合训练一组编码器网络的克隆体来提取显著特征。每个网络克隆体接收来自一组等价信号中不同信号作为输入。目标函数鼓励网络克隆体将其输入映射为跨克隆体一致的特征集合。它还鼓励特征独立性,并可选地鼓励由解码器重建期望的目标信号。作为一个应用,我们训练了一个系统,该系统提取语音的特征向量时间序列,并将其用作 WaveNet 生成系统的条件输入,从而同时促进编码与增强。

关键词

引用

@article{arxiv.1908.07045,
  title  = {Salient Speech Representations Based on Cloned Networks},
  author = {W. Bastiaan Kleijn and Felicia S. C. Lim and Michael Chinen and Jan Skoglund},
  journal= {arXiv preprint arXiv:1908.07045},
  year   = {2019}
}

备注

Interspeech 2019