基于互信息最小化的解耦说话人表示学习
音频与语音处理
2022-10-13 v3 声音
摘要
由与说话人无关特征引起的域失配问题一直是说话人识别中的一大主题。本文提出一种显式解耦框架,通过互信息(MI)最小化从与说话人无关特征中剥离出与说话人相关特征。为实现最小化说话人相关与无关特征间MI的目标,我们采用对比对数比上界(CLUB),其利用了MI的上界。我们的框架以三阶段结构构建。首先,在前端编码器中,输入语音被编码为共享初始嵌入。接着,在解耦模块中,共享初始嵌入被拆分为分离的说话人相关与无关嵌入。最后,在最后阶段通过MI最小化进行解耦。在Far-Field Speaker Verification Challenge 2022(FFSVC2022)上的实验表明,我们所提框架对解耦有效。此外,为利用包含大量说话人的域未知数据集,我们使用VoxCeleb数据集对前端编码器进行了预训练。随后,我们在FFSVC 2022数据集上用解耦框架对说话人嵌入模型进行微调。实验结果显示,在已有预训练模型上采用解耦框架进行微调是有效的,并能进一步提升性能。
引用
@article{arxiv.2208.08012,
title = {Disentangled Speaker Representation Learning via Mutual Information Minimization},
author = {Sung Hwan Mun and Min Hyun Han and Minchan Kim and Dongjune Lee and Nam Soo Kim},
journal= {arXiv preprint arXiv:2208.08012},
year = {2022}
}
备注
Accepted by APSIPA ASC 2022. Camera-ready. 8 pages, 4 figures, and 1 table