面向跨信道文本无关说话人识别的信道对抗训练
音频与语音处理
2019-02-26 v1 声音
摘要
当注册数据集与测试数据集的信道相似时,传统说话人识别框架(如 i-vector 与基于 CNN 的方法)已成功应用于各类任务。然而,在实际应用中,这两类数据集之间总是存在失配,可能严重劣化识别性能。此前已提出若干信道补偿算法,如线性判别分析(LDA)与概率性 LDA。但这些方法常需从特定说话人处采集不同信道,现实中难以满足。受域自适应启发,我们提出一种基于深度学习的新型说话人识别框架,通过信道对抗训练学习信道不变且说话人可分辨的语音表征。具体而言,我们首先采用梯度反转层消除跨信道差异,随后通过对抗训练将压缩信息投影至同一子空间。在含 54,133 名说话人的测试集上的实验表明,所提方法不仅能有效缓解信道失配问题,还优于当前最优说话人识别方法。相较于基于 i-vector 与基于 CNN 的方法,我们所提方法在 Top1 召回率上分别取得 44.7% 与 22.6% 的显著相对提升。
引用
@article{arxiv.1902.09074,
title = {Channel adversarial training for cross-channel text-independent speaker recognition},
author = {Xin Fang and Liang Zou and Jin Li and Lei Sun and Zhen-Hua Ling},
journal= {arXiv preprint arXiv:1902.09074},
year = {2019}
}
备注
5 pages, 2 figures, 2 tabels