基于注意力机制的视觉信息语音增强
音频与语音处理
2026-03-06 v1 人工智能
摘要
最近的研究表明,融合说话人声纹或视觉线索可显著提高语音增强 (Speech Enhancement, SE) 的性能。然而,单通道方法在信噪比 (SNR) 较低、高度混响或涉及动态说话人、重叠语音或非平稳噪声的复杂场景下往往效果不佳。为此,我们提出一种新的视觉信息神经阵列波束成形网络 (Visual-Informed Neural Beamforming Network, VI-NBFNet),将麦克风阵列信号处理与深度神经网络 (DNN) 集成,并利用多模态输入特征。该网络利用预训练的视觉语音识别模型提取唇部动作作为输入特征,用于语音活动检测 (VAD) 和目标说话人识别。该系统通过引入带有注意力机制的监督式端到端波束成形框架,以处理静态和动态说话人。实验结果表明,所提出的音视频系统在-stationary 和动态说话人场景下相较于多个基线方法实现了更好的语音增强性能和鲁棒性。
引用
@article{arxiv.2603.05270,
title = {Visual-Informed Speech Enhancement Using Attention-Based Beamforming},
author = {Chihyun Liu and Jiaxuan Fan and Mingtung Sun and Michael Anthony and Mingsian R. Bai and Yu Tsao},
journal= {arXiv preprint arXiv:2603.05270},
year = {2026}
}
备注
15 pages, 14 figures