面向XR头戴设备的鲁棒双模态语音关键词识别
人机交互
2024-01-29 v1 多媒体
声音
音频与语音处理
摘要
尽管语音交互在扩展现实(XR)领域得到了广泛应用,传统的声学语音关键词识别系统仍然面临严峻挑战,包括在嘈杂环境中性能不佳、在需要安静的情况下不切实际,以及在他人附近说话时容易误触发。然而,这些挑战可以通过经济高效地融合语音和唇动信息来克服。因此,我们提出了一种专为XR头戴设备设计的新型声学-回声双模态关键词识别系统。我们设计了两种不同的模态融合方法,并进行了实验以测试系统在不同场景下的性能。结果表明,我们的双模态系统不仅在典型和嘈杂环境中始终优于单模态系统,表现出更高的精度,而且在准确识别无声话语方面也表现出色。此外,我们已成功将该系统应用于实时演示,取得了令人鼓舞的结果。代码可在 https://github.com/caizhuojiang/VE-KWS 获取。
引用
@article{arxiv.2401.14978,
title = {Robust Dual-Modal Speech Keyword Spotting for XR Headsets},
author = {Zhuojiang Cai and Yuhan Ma and Feng Lu},
journal= {arXiv preprint arXiv:2401.14978},
year = {2024}
}
备注
Accepted to IEEE VR 2024