基于 Koopman 算子正则化的深度语音表示离散化用于说话人验证
声音
2026-03-09 v1 机器学习
摘要
人类语音包含语言内容和说话人相关特征,使说话人验证成为身份关键应用中的关键技术。现代深度学习说话人验证系统旨在学习对语音内容和环境噪声等nuisance因素不变的说话人表征。然而,许多现有方法依赖标记数据、文本监督或大规模预训练模型作为特征提取器,限制了可扩展性和实际部署,引发可持续性问题。我们提出了深度 Koopman 语音离散化自动编码器(DKSD-AE),这是一种结构化自动编码器,结合 novel 多步骤 Koopman 算子学习模块和实例归一化,以 disentangle 说话人和内容动力学。定量实验在多个数据集上表明,DKSD-AE 在说话人验证性能上达到或优于最先进的基线方法,同时保持较高的内容 EER,证明了有效的离散化。这些结果是在大幅减少参数数量且无需文本监督的情况下获得的。此外,性能在评估规模扩大时保持稳定,凸显了表示的鲁棒性和泛化能力。我们的发现表明,Koopman 基于时序建模结合实例归一化,为面向说话人聚焦的表示学习提供了一种高效且原则的方法。
关键词
引用
@article{arxiv.2603.05577,
title = {Koopman Regularized Deep Speech Disentanglement for Speaker Verification},
author = {Nikos Chazaridis and Mohammad Belal and Rafael Mestre and Timothy J. Norman and Christine Evers},
journal= {arXiv preprint arXiv:2603.05577},
year = {2026}
}
备注
This work has been submitted to the IEEE for possible publication