用于深度说话人特征学习的全信息训练
声音
2018-02-28 v3 机器学习
音频与语音处理
摘要
近期研究表明,通过精心设计的卷积与时延深度神经网络(CT-DNN)模型,可从极短语音段(如 0.3 秒)中学习说话人模式。通过迫使模型区分训练数据中的说话人,可从最后隐藏层导出帧级说话人特征。尽管性能良好,现有模型的一个潜在问题是它包含一个参数化分类器,即最后的仿射层,其可能消耗部分判别性知识,从而导致特征学习的“信息泄漏”。本文提出一种全信息训练方法,丢弃参数化分类器,并强制特征网络所学全部判别性知识均得以利用。我们在 Fisher 数据库上的实验表明,这一新训练方案能产生更一致的特征,从而在说话人验证任务上取得持续且显著的性能提升。
引用
@article{arxiv.1711.00366,
title = {Full-info Training for Deep Speaker Feature Learning},
author = {Lantian Li and Zhiyuan Tang and Dong Wang and Thomas Fang Zheng},
journal= {arXiv preprint arXiv:1711.00366},
year = {2018}
}
备注
Accepted by ICASSP 2018