AdaKWS:面向稳健关键词识别的测试时适应
音频与语音处理
2025-05-21 v1 声音
摘要
语音关键词识别(KWS)旨在识别音频中的关键词,以适用于各种应用,尤其是在边缘设备上。当前的小体积 KWS 系统侧重于高效模型设计。然而,其推理性能在未见环境或噪声背景下可能会下降。测试时适应(TTA)有助于模型在不需要原始训练数据的情况下适应测试样本。在本研究中,我们提出了 AdaKWS,据称是目前最佳的稳健 KWS TTA 方法。具体而言,我们首先通过选择基于预测熵最小化的可靠样本并调整每个 batch 的归一化统计来优化模型的置信度。我们引入伪关键词一致性(PKC)以识别关键可靠特征,同时避免对噪声过拟合。我们的实验表明,AdaKWS 在包括高斯噪声和真实场景噪声等各种条件下均优于其他方法。代码将在适当时发布。
引用
@article{arxiv.2505.14600,
title = {AdaKWS: Towards Robust Keyword Spotting with Test-Time Adaptation},
author = {Yang Xiao and Tianyi Peng and Yanghao Zhou and Rohan Kumar Das},
journal= {arXiv preprint arXiv:2505.14600},
year = {2025}
}
备注
Accepted by Interspeech 2025