基于偏移 delta 系数的端到端用户自定义关键词检测
声音
2024-05-24 v1 人工智能
音频与语音处理
摘要
识别用户自定义关键词对于个性化智能设备交互至关重要。以往的用户自定义关键词检测(UDKWS)方法依赖于如梅尔频谱系数(MFCC)等短期谱特征来检测 spoken keyword。然而,这些特征在准确识别音频文本对中紧密关联的发音方面可能面临挑战,due to其在捕捉语音信号时序动力学方面的有限能力。为解决此挑战,我们提出使用偏移 delta 系数(SDC),其通过纳入长期时序信息帮助捕捉发音变异性(连接音素之间的过渡)。在四个不同数据集上,使用基于跨注意力的端到端系统比较SDC特征与各种基准特征的性能。此外,探索了SDC的 various 配置以找到UDKWS任务的合适时序上下文。实验结果表明,SDC特征在Libriphrase-hard数据集上相较于MFCC基准特征在AUC上提升8.32%,在EER上提升8.69%。此外,该方法在与SOTA UDKWS技术进行比较时表现出色。
引用
@article{arxiv.2405.14489,
title = {End-to-End User-Defined Keyword Spotting using Shifted Delta Coefficients},
author = {Kesavaraj V and Anuprabha M and Anil Kumar Vuppala},
journal= {arXiv preprint arXiv:2405.14489},
year = {2024}
}