UniKW-AT:统一关键词 spotting 与音频标注
声音
2022-09-26 v1 音频与语音处理
摘要
在音频研究界与工业界,关键词 spotting(KWS)与音频标注(AT)被视为两个截然不同的任务与研究字段。然而从技术角度看,这两项任务是一致的:它们都为某固定尺寸的输入音频段预测一个标签(KWS 中为关键词,AT 中为声音事件)。本工作提出 UniKW-AT:一种联合训练 KWS 与 AT 的初步方法。UniKW-AT 增强了 KWS 的噪声鲁棒性,同时能够预测特定声音事件并实现基于声音事件的条件唤醒。我们的方法以描述关键词存在的附加标签扩展了 AT 流程。实验在 Google Speech Commands V1 (GSCV1) 与平衡 Audioset (AS) 数据集上进行。所提出的 MobileNetV2 模型在 GSCV1 数据集上达到 97.53% 准确率,在 AS 评测集上达到 33.4 的 mAP。此外,我们显示在真实世界 KWS 数据集上可观察到显著的噪声鲁棒性增益,大幅优于标准 KWS 方法。我们的研究表明 KWS 与 AT 可合并为单一框架而无显著性能退化。
引用
@article{arxiv.2209.11377,
title = {UniKW-AT: Unified Keyword Spotting and Audio Tagging},
author = {Heinrich Dinkel and Yongqing Wang and Zhiyong Yan and Junbo Zhang and Yujun Wang},
journal= {arXiv preprint arXiv:2209.11377},
year = {2022}
}
备注
Accepted in Interspeech2022