中文

面向鸡尾酒场景下酒吧情绪识别的多通道语音增强

声音 2026-02-24 v1

摘要

本文强调了多通道语音增强(MCSE)对于鸡尾酒场景下语音情绪识别(ER)的重要性。一种集成DNN-WPE和基于掩码的MVDR的多通道语音去回声和分离前端用于从混合语音中提取目标说话人的语音,然后输入到基于HuBERT和ViT的语音和视觉特征的下游ER后端。在使用IEMOCAP和MSP-FACE数据集构建的混合语测试中,实验表明MCSE输出始终优于在域内微调的单通道语音表示,后者包括:a)基于Conformer的度量GAN;和b)带可选SE-ER双任务微调的WavLM SSL特征。在加权准确率、未加权准确率和F1分数方面,分别相对于上述单通道基线获得了最高可达9.5个百分点、8.5个百分点和9.1个百分点的统计显著提升(分别为17.1%、14.7%和16.0%的相对提升)。还展示了IEMOCAP训练的MCSE前端在零样本应用于域外MSP-FACE数据时的泛化性。

关键词

引用

@article{arxiv.2602.18802,
  title  = {Multi-Channel Speech Enhancement for Cocktail Party Speech Emotion Recognition},
  author = {Youjun Chen and Guinan Li and Mengzhe Geng and Xurong Xie and Shujie Hu and Huimeng Wang and Haoning Xu and Chengxi Deng and Jiajun Deng and Zhaoqing Li and Mingyu Cui and Xunying Liu},
  journal= {arXiv preprint arXiv:2602.18802},
  year   = {2026}
}

备注

Accepted by ICASSP2026