PatchDSU:关键词识别中基于数据自由式持续学习的外分布 generalization 中的不确定性建模
音频与语音处理
2025-08-06 v1 机器学习
摘要
深度学习模型在诸多任务中表现出色,但依赖训练数据和测试数据遵循相同分布的假设。这一假设在实际语音系统中常不成立,由于环境、录音条件和说话人多样性的差异,分布迁移很常见。Domain Shifts with Uncertainty(DSU)方法基于输入特征统计信息为每个神经网络层增强输入,通过假设特征统计遵循多变量高斯分布并用从该分布中抽样的特征来替换输入,从而解决外域泛化问题。虽然DSU对计算机视觉有效,但将其应用于语音识别面临挑战,因为语音是一种时序信号,常以频谱图形式表示——即频率随时间的变化。这种表示不能被简单地视为图像,导致整体应用后特征统计偏斜。为解决关键词识别中的外分布问题,我们提出了PatchDSU,通过将输入分割为多个小块,独立增强每个小块。我们在Google Speech Commands、 Librispeech和TED-LIUM数据集上评估了PatchDSU和DSU以及其他方法。此外,我们在白色高斯噪声和MUSAN音乐噪声条件下评估了性能。我们还通过分析模型在未训练数据集上的表现来探讨外域泛化。总体而言,在大多数情况下,PatchDSU和DSU均优于其他方法。值得注意的是,PatchDSU在所评估的各种情景中都表现出比其他方法更一致的改进。
引用
@article{arxiv.2508.03190,
title = {PatchDSU: Uncertainty Modeling for Out of Distribution Generalization in Keyword Spotting},
author = {Bronya Roni Chernyak and Yael Segal and Yosi Shrem and Joseph Keshet},
journal= {arXiv preprint arXiv:2508.03190},
year = {2025}
}
备注
This work has been submitted to the IEEE for possible publication