中文

基于伪标签的神经语音增强用于MISP-Meeting挑战赛中的AVSR任务

声音 2025-06-24 v2 音频与语音处理

摘要

本文介绍了我们为MISP-Meeting挑战赛Track 2设计的系统。主要困难在于数据集包含强烈的背景噪声、混响、重叠语音和多样的会议主题。为了解决这些问题,我们 设计了G-SpatialNet,一种用于改进Guided Source Separation(GSS)信号的语音增强(SE)模型; 提出了TLS,一个包含时间对齐、电平对齐和信噪比过滤的框架,用于为真实录制的远场音频数据生成信号级伪标签,从而促进SE模型的训练; 探索了微调策略、数据增强和多模态信息,以提升预训练自动语音识别(ASR)模型在会议场景中的性能。最终,我们的系统在Dev和Eval集上分别实现了5.44%和9.52%的字符错误率(CER),相比基线相对提升了64.8%和52.6%,获得了第二名。

关键词

引用

@article{arxiv.2505.24446,
  title  = {Pseudo Labels-based Neural Speech Enhancement for the AVSR Task in the MISP-Meeting Challenge},
  author = {Longjie Luo and Shenghui Lu and Lin Li and Qingyang Hong},
  journal= {arXiv preprint arXiv:2505.24446},
  year   = {2025}
}

备注

Accepted by InterSpeech 2025