通过正交正则化学习解耦特征
声音
2022-04-01 v1 人工智能
音频与语音处理
摘要
关键词 spotting (KWS) 与说话人验证 (SV) 是语音应用中的两项重要任务。研究表明,最先进的 KWS 和 SV 模型是使用不同数据集独立训练的,因为它们期望学习不同的声学特征。然而,人类能够同时区分语言内容与说话人身份。受此启发,我们认为探索一种能有效提取共性特征同时解耦任务特定特征的方法十分重要。基于此,我们构建了一个具有相同网络结构的两分支深度网络(KWS 分支与 SV 分支),并提出一种新颖的解耦特征学习方法,以同时提升 KWS 和 SV 性能,分别期望得到说话人不变的关键词表示和关键词不变的说话人表示。实验在 Google Speech Commands Dataset (GSCD) 上进行。结果表明,正交正则化帮助网络在 KWS 和 SV 上分别达到 1.31% 和 1.87% 的 SOTA EER。
引用
@article{arxiv.2203.16772,
title = {Learning Decoupling Features Through Orthogonality Regularization},
author = {Li Wang and Rongzhi Gu and Weiji Zhuang and Peng Gao and Yujun Wang and Yuexian Zou},
journal= {arXiv preprint arXiv:2203.16772},
year = {2022}
}
备注
Accepted at ICASSP 2022