中文

基于言语与非言语特征的多模态设备指向语音检测中的模态丢弃

声音 2023-10-25 v1 人机交互 机器学习 音频与语音处理

摘要

设备指向语音检测(DDSD)是一项二分类任务,用于区分指向语音助手的问题与旁侧对话或背景语音。最先进的 DDSD 系统利用言语线索(例如声学、文本和/或自动语音识别系统(ASR)特征)将语音分类为设备指向或非设备指向,并且在真实场景部署时常常不得不应对这些模态中的一个或多个不可用的情况。在本文中,我们研究了可使 DDSD 系统对缺失模态更具鲁棒性的融合方案。同时,我们研究了除言语线索外使用非言语线索(特别是韵律特征)进行 DDSD。我们提出了将韵律的分数与嵌入和相应言语线索相结合的不同方法,发现通过非线性中间融合,在给定固定工作点下,韵律使 DDSD 性能在误接受率(FA)方面提升高达 8.5%,而我们使用的模态丢弃技术在这些模型于推理时存在缺失模态的评估中使 FA 性能提升 7.4%。

关键词

引用

@article{arxiv.2310.15261,
  title  = {Modality Dropout for Multimodal Device Directed Speech Detection using Verbal and Non-Verbal Features},
  author = {Gautam Krishna and Sameer Dharur and Oggi Rudovic and Pranay Dighe and Saurabh Adya and Ahmed Hussen Abdelaziz and Ahmed H Tewfik},
  journal= {arXiv preprint arXiv:2310.15261},
  year   = {2023}
}

备注

5 pages