中文

双混合:迈向语音的持续事件检测

计算与语言 2024-10-29 v2 多媒体 声音 音频与语音处理

摘要

语音事件检测对于多媒体检索至关重要,涉及语义事件和声学事件的标注。传统的自动语音识别系统往往忽视这些事件之间的相互作用,仅关注内容,尽管对话的解释可能随环境背景而变化。本文解决了语音事件检测中的两个主要挑战:在不遗忘先前事件的情况下持续整合新事件,以及将语义事件与声学事件解耦。我们引入了一个新任务——语音持续事件检测,并为此提供了两个基准数据集。为了应对灾难性遗忘和有效解耦的挑战,我们提出了一种新颖方法“双混合”。该方法将语音专业知识与稳健的记忆机制相结合,以增强适应性并防止遗忘。我们的综合实验表明,该任务带来了当前计算机视觉或自然语言处理领域最先进方法无法有效解决的重大挑战。我们的方法实现了最低的遗忘率和最高的泛化水平,在各种持续学习序列中表现出稳健性。我们的代码和数据可在https://anonymous.4open.science/status/Continual-SpeechED-6461获取。

关键词

引用

@article{arxiv.2404.13289,
  title  = {Double Mixture: Towards Continual Event Detection from Speech},
  author = {Jingqi Kang and Tongtong Wu and Jinming Zhao and Guitao Wang and Yinwei Wei and Hao Yang and Guilin Qi and Yuan-Fang Li and Gholamreza Haffari},
  journal= {arXiv preprint arXiv:2404.13289},
  year   = {2024}
}

备注

The first two authors contributed equally to this work