中文

用于鲁棒语音词检测与关键词 spotting 的联合多模态对比学习

声音 2025-12-17 v1 机器学习

摘要

声学词嵌入(AWEs)提升了语音检索任务的效率,例如语音词检测(STD)与关键词 spotting(KWS)。然而,现有方法存在诸多局限性,包括单模态监督、音频-音频与音频-文本对齐的分离优化,以及对特定任务模型的需求。为解决这些缺陷,我们提出了一种联合多模态对比学习框架,在共享嵌入空间中统一了声学监督与跨模态监督。我们的方法同时优化了:(i)受 CLAP loss 启发的音频-文本对比学习,用于对齐音频与文本表示;以及(ii)通过 Deep Word Discrimination(DWD)损失实现的音频-音频对比学习,用于增强类内紧凑性与类间可分性。所提方法在词判别任务上优于现有 AWE 基线,同时灵活支持 STD 与 KWS。据我们所知,这是首个此类综合性方法。

关键词

引用

@article{arxiv.2512.14115,
  title  = {Joint Multimodal Contrastive Learning for Robust Spoken Term Detection and Keyword Spotting},
  author = {Ramesh Gundluru and Shubham Gupta and Sri Rama Murty K},
  journal= {arXiv preprint arXiv:2512.14115},
  year   = {2025}
}