利用全脸视觉信息的 Mamba 模型进行音视频语音增强
声音
2025-10-01 v2 音频与语音处理
摘要
最近的 Mamba 模型在通过高效建模长程时序依赖性方面在语音增强方面显示出前景。然而,诸如 Speech Enhancement Mamba(SEMamba) 等模型仅限于单说话人场景,在诸如“鸡尾酒派对”问题等复杂多说话人环境中仍受限。为克服这一限制,我们引入 AVSEMamba,这是一个集成全脸视觉线索的音视频语音增强模型。通过利用时空视觉信息,AVSEMamba 能够更准确地提取目标语音在恶劣条件下的表现。在 AVSEC-4 挑战开发和盲测试集上进行评估,AVSEMamba 在语音可懂性(STOI)、感知质量(PESQ)和非侵入式质量(UTMOS)方面均优于其他单声道基线方法,并在单声道排行榜中获得 **第 1 名**。
引用
@article{arxiv.2508.13624,
title = {Leveraging Mamba with Full-Face Vision for Audio-Visual Speech Enhancement},
author = {Rong Chao and Wenze Ren and You-Jin Li and Kuo-Hsuan Hung and Sung-Feng Huang and Szu-Wei Fu and Wen-Huang Cheng and Yu Tsao},
journal= {arXiv preprint arXiv:2508.13624},
year = {2025}
}
备注
Accepted to Interspeech 2025 Workshop