中文

面向多方智能体互动的面向交叉干扰鲁棒的多通道语音活动检测模型

声音 2024-02-16 v1 人机交互 音频与语音处理

摘要

本文提出一种 novel 框架,用于多通道多说话人场景下的交叉干扰抑制,适用于现场多方智能体互动节目。我们的远场音频 setup 要求在现场互动期间保持 hands-free,由四个相邻说话人在同一空间内配置定向麦克风组成。此类 setup 常导致通道之间产生严重的交叉干扰,降低自动语音识别(ASR)和自然语言理解(NLU)性能。为解决此问题,我们提出一种基于多通道信息的语音活动检测(VAD)模型,用于所有说话人,然后用于过滤下游任务的音频。我们采用播放和重新录制的合成训练数据生成方法,以模拟具有挑战性语音重叠条件的场景。我们在该合成数据上训练模型,并证明该方法在各种声学环境下优于单通道 VAD 模型和能量基准的多通道 VAD 算法。除了 VAD 结果,我们还展示了多方 ASR 评估结果,以突出使用我们的 VAD 模型过滤下游任务音频对显著降低插入错误的影响。

关键词

引用

@article{arxiv.2402.09797,
  title  = {A cross-talk robust multichannel VAD model for multiparty agent interactions trained using synthetic re-recordings},
  author = {Hyewon Han and Naveen Kumar},
  journal= {arXiv preprint arXiv:2402.09797},
  year   = {2024}
}

备注

Accepted for presentation at the Hands-free Speech Communication and Microphone Arrays (HSCMA 2024)