中文

融合前净化:面向无掩码语音增强的鲁棒音视频语音识别

音频与语音处理 2026-03-09 v2 人工智能 机器学习 多媒体 声音

摘要

音视频语音识别(AVSR)通常通过整合噪声免疫的视觉线索与音频信号来提高嘈杂环境下的识别准确率。然而,高噪声音频输入容易在特征融合过程中引入不良干扰。为缓解此问题,近期的AVSR方法常采用基于掩码的策略,以滤除特征交互和融合期间的音频噪声,但此类方法风险在于同时丢弃了与噪声相关的语义信息。本文提出一种无需显式噪声掩码生成的端到端噪声鲁棒AVSR框架,集成语音增强功能。该框架利用基于Conformer的瓶颈融合模块,借助视频辅助隐式地细化嘈杂音频特征。通过减少模态冗余度并增强跨模态互动,本方法保留了语音语义完整性,以实现稳健的识别性能。在公开LRS3基准测试上的实验评估表明,在嘈杂条件下,我们的方法优于先前的高级基于掩码基线方法。

关键词

引用

@article{arxiv.2601.12436,
  title  = {Purification Before Fusion: Toward Mask-Free Speech Enhancement for Robust Audio-Visual Speech Recognition},
  author = {Linzhi Wu and Xingyu Zhang and Hao Yuan and Yakun Zhang and Changyan Zheng and Liang Xie and Tiejun Liu and Erwei Yin},
  journal= {arXiv preprint arXiv:2601.12436},
  year   = {2026}
}

备注

Accepted by ICASSP2026