基于交叉注意力和Squeezeformer的音视频统一表示交换架构用于语音增强
声音
2025-10-14 v1 人工智能
多媒体
摘要
本文提出了AUREXA-SE(Audio-Visual Unified Representation Exchange Architecture with Cross-Attention and Squeezeformer for Speech Enhancement),一个针对音视频语音增强(AVSE)的渐进式双模框架。AUREXA-SE通过采用基于U-Net的1D卷积编码器处理原始音频波形,以及使用Swin Transformer V2进行高效且富有表达力的视觉特征提取,联合利用原始音频波形和视觉线索。该架构的核心是一种新颖的双向交叉注意力机制,促进了模态之间深层语境融合,实现丰富且互补的表征学习。为捕捉融合嵌入向量中随时间变化的依赖关系,引入一叠轻量级的Squeezeformer模块,结合卷积和注意力组件。增强后的嵌入向量随后通过基于U-Net的解码器进行解码,以实现波形的直接重建,确保语音输出在感知和可理解性方面的一致性。实验评估表明,AUREXA-SE的有效性显而易见,相较于带噪基线实现了显著的性能提升,STOI为0.516,PESQ为1.323,SI-SDR为-4.322 dB。AUREXA-SE的源代码可在 https://github.com/mtanveer1/AVSEC-4-Challenge-2025 查阅。
引用
@article{arxiv.2510.05295,
title = {AUREXA-SE: Audio-Visual Unified Representation Exchange Architecture with Cross-Attention and Squeezeformer for Speech Enhancement},
author = {M. Sajid and Deepanshu Gupta and Yash Modi and Sanskriti Jain and Harshith Jai Surya Ganji and A. Rahaman and Harshvardhan Choudhary and Nasir Saleem and Amir Hussain and M. Tanveer},
journal= {arXiv preprint arXiv:2510.05295},
year = {2025}
}